跳到主要內容
AI 武林
影片高階EN1.3 萬 次觀看

Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

第六講由 Aakanksha Chowdhery 教授主講,深入探討「訓練時間縮放」技術,透過 STaR、DeepSeekMath 與 DAPO 三篇論文,展示如何利用模型自身輸出進行自我改進。課程說明如何讓小規模模型在數學推理等領域達到高準確度,並解析強化學習在長鏈式推理中的穩定性挑戰與解決方案。

This lecture covers train-time scaling techniques using STaR, DeepSeekMath, and DAPO to improve small models' reasoning capabilities via self-improvement loops and stable reinforcement learning.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • STaR 透過理性化與過濾正確答案,讓模型自我引導推理鏈。
  • DeepSeekMath 引入群相對策略最佳化,提升小模型數學推理能力。
  • DAPO 解決長鏈式推理中強化學習的熵崩塌與訓練不穩定問題。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05AIME benchmarks 飽和,轉向更複雜數學推理
  2. 02:55訓練時間縮放:讓模型從自身輸出中學習
  3. 07:44Gemini 思考模型:逐步推理與自我評估
  4. 09:59任務分解與自我修正提升複雜問題解決
  5. 24:39STaR 方法透過注入推理過程增強模型
  6. 34:34自改進 AI 的實務限制與知識蒸餾對比
  7. 37:23STaR 效能受模型既有推理能力與訓練資料限制
  8. 40:41DeepSeekMath 利用網頁資料提升數學推理
  9. 44:15GRPO 技術減少模型副本並最佳化梯度計算
  10. 48:49問題分佈與獎勵訊號對學習的重要性
  11. 52:42DAPO 解決模型熵坍縮與探索能力問題
  12. 56:27DAPO 透過 Token 損失控制回應長度與熵
  13. 1:00:14RL 訓練中回應長度、熵與樣本比例原則
  14. 1:05:25可驗證獎勵在複雜推理任務中的挑戰

提到的工具與公司

  • STaR
  • DeepSeekMath
  • DAPO
  • PPO
  • AIME
  • Qwen-32B
  • GPT-3.5

適合誰看

正在學習大語言模型推理增強、強化學習穩定性或 AI 代理技術的程式開發者與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.63
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)