影片進階EN1.1 萬 次觀看
Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
深入探討利用搜尋技術提升 AI 模型的方法,以 AlphaCode 和 AlphaCode 2 為例,說明如何透過大規模取樣、篩選與聚類來解決程式競賽問題。同時介紹 Search-O1 等技術,讓推理模型在表達不確定時主動搜尋並檢索文件,以改善深度研究代理的表現。
This lecture explains how search-based methods like AlphaCode and Search-O1 improve AI agents for complex coding and reasoning tasks through large-scale sampling and iterative refinement.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- AlphaCode 透過大規模取樣與聚類篩選,在程式競賽中達到前 54% 排名。
- AlphaCode 2 結合自訂評分模型,將表現提升至人類競爭者的前 85%。
- Search-O1 讓模型在推理不確定時主動搜尋文件,有效降低錯誤率。
章節
依話題轉折切分,標題由 AI 產生
- 00:05AlphaCode 與 AlphaCode 2 的搜尋策略概覽
- 04:02利用 GitHub 資料與競賽題目進行預訓練
- 07:40透過聚類機制篩選多樣性解法以閉環評估
- 10:19不同問題情境下模型表現的變異性分析
- 23:02大規模取樣在效率與難題領域的侷限性
- 25:35引入獎勵模型與 CodeContests V2 資料集最佳化
- 29:30AlphaCode 2 的取樣預算與解題率提升效果
- 34:54多模型架構與評分機制設計
- 38:51樣本效率與任務複雜度調整
- 41:48訓練資料嵌入推理提示
- 45:46任務分解與人類迴路介入
- 1:01:13Search-o1 深度研究代理架構
- 1:04:02跨領域專家表現與多跳問答
- 1:09:13生成機率校準與實驗驗證
提到的工具與公司
- AlphaCode
- AlphaCode2
- Gemini Pro
- CodeContests
- Codeforces
- Search-O1
- GPQA
適合誰看
正在學習或研究 AI 代理、程式生成或測試時間計算(test-time compute)的開發者與研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.62
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CS329A Self-Improving AI Agents | Part 9 | Future Research Areas影片 ・ Stanford Online ・ 1 小時 8 分
- EP129|AI 搜尋(AI Search)的時代開啟了Podcast ・ 曼報 ・ 1 小時 20 分
- Stanford CS329A Self-Improving AI Agents | Part 5 | Planning and Multi-Step Reasoning影片 ・ Stanford Online ・ 1 小時 15 分
- Andrej Karpathy on Code Agents, AutoResearch, and the Loopy Era of AIPodcast ・ No Priors ・ 1 小時 7 分
- Episode 68: A Builder’s Guide to Agentic Search & Retrieval with Doug Turnbull & John BerrymanPodcast ・ Vanishing Gradients ・ 1 小時 29 分
- Agentic Search: 搜尋技術不會消失,只是變成 Agent 工具文章 ・ ihower(張文鈿)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
