跳到主要內容
AI 武林

Deep (Learning) Focus(Cameron R. Wolfe)

部落格 ・ 國際 ・ 英文 ・ A 級 ・ 15 筆內容 ・ 最近更新 2026/09/28

把一個研究主題的十幾篇論文整理成一篇長文(LLM 的強化學習、midtraining、agentic world models),適合想補原理的工程師

最受歡迎

依人氣

  1. 1文章高階EN

    RL Scaling Laws for LLMs

    深入探討大型語言模型在預訓練與強化學習階段中,如何應用與演變「擴展定律」。讀者將了解從預訓練到強化學習的擴展定律差異,學習如何透過數學模型預測訓練效能,並掌握最佳化計算資源分配的實際策略。

  2. 2文章高階EN

    Applying Statistics to LLM Evaluations

    介紹如何運用統計學方法提升大型語言模型的評估品質,避免誤將隨機波動視為進步。讀者將學習計算標準誤差、建立置信區間,並掌握配對分析與聚簇調整等實務技巧,讓評估結果更具說服力。

  3. 5文章進階EN

    Agent Evaluation: A Detailed Guide

    詳細介紹如何評估 AI 代理系統,涵蓋從基礎概念到實作框架。讀者將學習如何建立真實的評估環境、使用程式碼與模型評分器,並透過案例研究掌握最佳實踐,以確保代理在複雜任務中的表現可靠。

  4. 6文章高階EN

    Reinforcement Learning for LLMs: The Complete Guide

    從第一原理出發,系統介紹強化學習在大型語言模型中的演進與應用,涵蓋基礎概念、策略梯度演算法(如 PPO、GRPO)及最新研究。讀者可掌握 RL 訓練 LLM 的核心邏輯與實作細節,並了解當前前沿技術方向。

  5. 7文章高階EN

    Continual Learning with RL for LLMs

    探討大型語言模型在持續學習中的挑戰,特別是「災難性遺忘」問題。文章比較了監督微調(SFT)與強化學習(RL)在維持舊任務表現與學習新任務之間的平衡,指出 RL 能有效減少遺忘。

  6. 8文章高階EN

    Rubric-Based Rewards for RL

    介紹如何將基於規則的獎勵(Rubric-Based Rewards)應用於非可驗證領域的強化學習,解決傳統神經獎勵模型在創意寫作等主觀任務中的不足。

最新內容

依發布時間

  1. 文章高階EN

    Reinforcement Learning for LLMs: The Complete Guide

    從第一原理出發,系統介紹強化學習在大型語言模型中的演進與應用,涵蓋基礎概念、策略梯度演算法(如 PPO、GRPO)及最新研究。讀者可掌握 RL 訓練 LLM 的核心邏輯與實作細節,並了解當前前沿技術方向。

  2. 文章高階EN

    Agentic RL: Frameworks and Best Practices

    介紹訓練大型語言模型(LLM)以處理長時程複雜任務的代理強化學習(Agentic RL)框架與最佳實踐。內容涵蓋代理系統的核心元件、多回合滾動訓練機制,以及不同環境下的實驗驗證結果。讀者可學習如何設計高效能的自主 AI 系統。

  3. 文章進階EN

    Agent Evaluation: A Detailed Guide

    詳細介紹如何評估 AI 代理系統,涵蓋從基礎概念到實作框架。讀者將學習如何建立真實的評估環境、使用程式碼與模型評分器,並透過案例研究掌握最佳實踐,以確保代理在複雜任務中的表現可靠。

  4. 文章高階EN

    RL Scaling Laws for LLMs

    深入探討大型語言模型在預訓練與強化學習階段中,如何應用與演變「擴展定律」。讀者將了解從預訓練到強化學習的擴展定律差異,學習如何透過數學模型預測訓練效能,並掌握最佳化計算資源分配的實際策略。

  5. 文章高階EN

    Applying Statistics to LLM Evaluations

    介紹如何運用統計學方法提升大型語言模型的評估品質,避免誤將隨機波動視為進步。讀者將學習計算標準誤差、建立置信區間,並掌握配對分析與聚簇調整等實務技巧,讓評估結果更具說服力。

  6. 文章高階EN

    Rubric-Based Rewards for RL

    介紹如何將基於規則的獎勵(Rubric-Based Rewards)應用於非可驗證領域的強化學習,解決傳統神經獎勵模型在創意寫作等主觀任務中的不足。

  7. 文章高階EN

    Continual Learning with RL for LLMs

    探討大型語言模型在持續學習中的挑戰,特別是「災難性遺忘」問題。文章比較了監督微調(SFT)與強化學習(RL)在維持舊任務表現與學習新任務之間的平衡,指出 RL 能有效減少遺忘。

  8. 文章高階EN

    GRPO++: Tricks for Making RL Actually Work

    介紹如何將基礎的 GRPO 演算法改造成適合大規模訓練的實用方案,涵蓋模板選擇、優勢計算與損失函式調整等技巧。讀者能掌握提升推理模型品質的關鍵實踐,並理解 RLVR 與 RL-Zero 的訓練架構。