影片進階EN1.1 萬 次觀看
Stanford CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
章節探討如何評估 AI 代理在長時程任務中的表現,並介紹 METR 時間軸與 GDPval 經濟價值評估方法。內容涵蓋軟體工程、學術研究及專業領域任務的實測資料,分析模型能力增長趨勢與失敗模式。
This lecture covers methods for evaluating AI agents on long-horizon and economically valuable tasks, including METR and GDPval benchmarks, with analysis of model performance trends and failure modes.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 介紹 METR 與 GDPval 兩種評估 AI 代理長時程任務的方法。
- 展示模型在軟體工程與學術研究任務上的表現趨勢。
- 分析模型在指令遵循與資料引用上的常見失敗模式。
章節
依話題轉折切分,標題由 AI 產生
- 00:05課程聚焦基因評估與長程任務
- 12:28模型成功率高與任務時長成反比
- 15:01邏輯推理與工具使用驅動進步
- 19:02可靠性指標顯示模型仍有瓶頸
- 21:50模型常見失敗模式為重複迴圈
- 25:50內部專案中合約工效能遠低於維護者
- 32:51評估涵蓋九個高經濟價值產業領域
- 35:36GPT-5 與 Claude Opus 4.1 勝率呈線性成長
- 38:13模型在美學任務優異但指令遵循常失敗
- 42:02模型在短程任務表現佳長程任務則衰退
- 51:09AI 難以模擬專家篩選文獻與綜合研究
- 1:02:49現行基準無法完全反映真實世界資源限制
- 1:10:5350% 任務成功率定義為各任務平均成功率的平均值
- 1:14:13特定領域模型進步緩慢而通用領域較快
提到的工具與公司
- METR
- GDPval
- HCAST
- SWE-bench
- RE-Bench
- DeepScholar-Bench
- GPT-4o
- Claude Opus 4.1
適合誰看
正在開發或評估 AI 代理系統、需要進行長時程任務測試的研究人員或工程師。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.62
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Agents文章 ・ Chip Huyen(部落格)
- The AI Models Smart Enough to Know They're Cheating — Beth Barnes & David Rein [METR]Podcast ・ Machine Learning Street Talk ・ 1 小時 53 分
- Behavior specs for long-trajectory agents影片 ・ Braintrust ・ 3 分鐘(在新分頁開啟原站)
- How to Build Long-Horizon AI Agents — Mitch Troyanovsky, BasisPodcast ・ The MAD Podcast ・ 1 小時 23 分
- Evals for taste: Hill-climbing a slide-generation agent影片 ・ Claude ・ 39 分鐘
- Aayush Agrawal - Evals: The Engine for Agent Improvement影片 ・ Berkeley RDI ・ 6 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
