影片高階EN1.3 萬 次觀看
Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
第六講由 Aakanksha Chowdhery 教授主講,深入探討「訓練時間縮放」技術,透過 STaR、DeepSeekMath 與 DAPO 三篇論文,展示如何利用模型自身輸出進行自我改進。課程說明如何讓小規模模型在數學推理等領域達到高準確度,並解析強化學習在長鏈式推理中的穩定性挑戰與解決方案。
This lecture covers train-time scaling techniques using STaR, DeepSeekMath, and DAPO to improve small models' reasoning capabilities via self-improvement loops and stable reinforcement learning.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- STaR 透過理性化與過濾正確答案,讓模型自我引導推理鏈。
- DeepSeekMath 引入群相對策略最佳化,提升小模型數學推理能力。
- DAPO 解決長鏈式推理中強化學習的熵崩塌與訓練不穩定問題。
章節
依話題轉折切分,標題由 AI 產生
- 00:05AIME benchmarks 飽和,轉向更複雜數學推理
- 02:55訓練時間縮放:讓模型從自身輸出中學習
- 07:44Gemini 思考模型:逐步推理與自我評估
- 09:59任務分解與自我修正提升複雜問題解決
- 24:39STaR 方法透過注入推理過程增強模型
- 34:34自改進 AI 的實務限制與知識蒸餾對比
- 37:23STaR 效能受模型既有推理能力與訓練資料限制
- 40:41DeepSeekMath 利用網頁資料提升數學推理
- 44:15GRPO 技術減少模型副本並最佳化梯度計算
- 48:49問題分佈與獎勵訊號對學習的重要性
- 52:42DAPO 解決模型熵坍縮與探索能力問題
- 56:27DAPO 透過 Token 損失控制回應長度與熵
- 1:00:14RL 訓練中回應長度、熵與樣本比例原則
- 1:05:25可驗證獎勵在複雜推理任務中的挑戰
提到的工具與公司
- STaR
- DeepSeekMath
- DAPO
- PPO
- AIME
- Qwen-32B
- GPT-3.5
適合誰看
正在學習大語言模型推理增強、強化學習穩定性或 AI 代理技術的程式開發者與研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.63
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview影片 ・ Stanford Online ・ 1 小時 10 分
- Stanford CS329A Self-Improving AI Agents | Part 9 | Future Research Areas影片 ・ Stanford Online ・ 1 小時 8 分
- EP414 – 史丹佛 AI Agent 課 CS329A 整理:Agent 怎麼自己變強?一次看懂 ReAct、RLEF、Constitutional AIPodcast ・ AI懶人報 ・ 21 分鐘
- AI Trends 2026: OpenClaw Agents, Reasoning LLMs, and More with Sebastian Raschka - #762Podcast ・ The TWIML AI Podcast ・ 1 小時 19 分
- Hugging Face Journal Club: Scaling Laws for Pre-training & RL影片 ・ Hugging Face ・ 31 分鐘(在新分頁開啟原站)
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
