跳到主要內容
AI 武林
影片進階EN1.1 萬 次觀看

Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

深入探討利用搜尋技術提升 AI 模型的方法,以 AlphaCode 和 AlphaCode 2 為例,說明如何透過大規模取樣、篩選與聚類來解決程式競賽問題。同時介紹 Search-O1 等技術,讓推理模型在表達不確定時主動搜尋並檢索文件,以改善深度研究代理的表現。

This lecture explains how search-based methods like AlphaCode and Search-O1 improve AI agents for complex coding and reasoning tasks through large-scale sampling and iterative refinement.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • AlphaCode 透過大規模取樣與聚類篩選,在程式競賽中達到前 54% 排名。
  • AlphaCode 2 結合自訂評分模型,將表現提升至人類競爭者的前 85%。
  • Search-O1 讓模型在推理不確定時主動搜尋文件,有效降低錯誤率。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05AlphaCode 與 AlphaCode 2 的搜尋策略概覽
  2. 04:02利用 GitHub 資料與競賽題目進行預訓練
  3. 07:40透過聚類機制篩選多樣性解法以閉環評估
  4. 10:19不同問題情境下模型表現的變異性分析
  5. 23:02大規模取樣在效率與難題領域的侷限性
  6. 25:35引入獎勵模型與 CodeContests V2 資料集最佳化
  7. 29:30AlphaCode 2 的取樣預算與解題率提升效果
  8. 34:54多模型架構與評分機制設計
  9. 38:51樣本效率與任務複雜度調整
  10. 41:48訓練資料嵌入推理提示
  11. 45:46任務分解與人類迴路介入
  12. 1:01:13Search-o1 深度研究代理架構
  13. 1:04:02跨領域專家表現與多跳問答
  14. 1:09:13生成機率校準與實驗驗證

提到的工具與公司

  • AlphaCode
  • AlphaCode2
  • Gemini Pro
  • CodeContests
  • Codeforces
  • Search-O1
  • GPQA

適合誰看

正在學習或研究 AI 代理、程式生成或測試時間計算(test-time compute)的開發者與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.62
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)