跳到主要內容
AI 武林
影片進階EN1.8 萬 次觀看

Stanford CS329A Self-Improving AI Agents | Part 5 | Planning and Multi-Step Reasoning

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

由斯坦福大學 Azalia Mirhoseini 教授主講,深入解析三篇關於語言模型代理的規劃與多步驟推理論文。內容涵蓋結合蒙特卡洛樹搜尋的 LATS 方法、利用並行執行提升效率的 SPRINT 模型,以及透過合成資料訓練實現跨任務泛化的 SWiRL 技術。觀眾可學習如何設計多步驟推理框架、最佳化推理成本並提升模型在數學與工具使用上的準確度。

This lecture covers three papers on planning and multi-step reasoning in AI agents, including LATS, SPRINT, and SWiRL, detailing their methods for improving reasoning, parallelism, and generalization.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • LATS 結合蒙特卡洛樹搜尋與 LLM 評分,最佳化多步驟規劃與探索。
  • SPRINT 讓模型並行生成獨立計劃,減少序列 token 並提升數學準確度。
  • SWiRL 透過合成資料與多步驟強化學習,實現跨工具與領域的泛化能力。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05語言代理樹搜尋整合推理與規劃
  2. 10:05結合 LLM 評分與一致性分數
  3. 13:27引入 UCT 平衡探索與利用
  4. 16:31透過反思機制提升 HotPotQA 表現
  5. 19:53探討不可逆動作與多臂問題
  6. 23:11利用 SPRINT 實現並行推理
  7. 28:06使用 GPT-4o 標註規劃與執行步驟
  8. 35:43並行執行規劃提升推理效率
  9. 46:46訓練模型學會並行生成步驟
  10. 50:03SWiRL 方法引入工具使用
  11. 54:48RL 過程避免訓練時呼叫工具
  12. 1:06:09資料過濾策略影響模型表現
  13. 1:11:05強化學習優於監督微調效果
  14. 1:14:23多步驟推理與規劃領域總結

提到的工具與公司

  • DeepSeek-R1
  • SymPy
  • GSM8K
  • HotpotQA
  • UCT
  • ReAct

適合誰看

適合正在研究 AI 代理、多步驟推理或希望最佳化大型語言模型規劃能力的開發者與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.66
新鮮
0.79

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)