影片進階EN509 次觀看
Simon Obstbaum & Rob Willoughby - Why evals are hard and how we're solving it - AI Native DevCon Jun
看影片(在新分頁開啟原站)連到 AI Native Dev
摘要
演講者 Simon Obstbaum 與 Rob Willoughby 探討如何評估 AI 代理的實際行為,區分僅看輸出結果與追蹤完整執行軌跡(trajectory evals)的差異。透過 Stanford 大規模研究與 Tessl 工具,展示如何透過真實追蹤資料與機器學習模型,更精準地衡量 AI 工程師的生產力與代理效能。
Speakers discuss evaluating AI agent behavior through trajectory evals and real trace data to measure productivity and performance accurately.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 區分輸出評估與軌跡評估,能發現代理是否真正遵循指令。
- 透過大規模研究發現,會編寫代理的人生產力顯著高於他人。
- 利用真實追蹤資料與機器學習模型,更精準衡量代理效能。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- Tessl
- Stanford SEPR Lab
- Claude Code
- Cursor
- Gemini
- IEEE Automation Software Engineering
適合誰看
負責開發 AI 代理、需要評估系統效能或最佳化生產力的軟體工程師。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.23
- 新鮮
- 0.76
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Behavior specs for long-trajectory agents影片 ・ Braintrust ・ 3 分鐘(在新分頁開啟原站)
- Aayush Agrawal - Evals: The Engine for Agent Improvement影片 ・ Berkeley RDI ・ 6 分鐘(在新分頁開啟原站)
- Introducing LangSmith Trajectories: A readable view of every agent session影片 ・ LangChain(在新分頁開啟原站)
- Why Your AI Agent Fails in Production (And How to Catch It)影片 ・ Google Cloud Tech ・ 26 分鐘(在新分頁開啟原站)
- Online workshop: Evals foundations影片 ・ Braintrust ・ 42 分鐘(在新分頁開啟原站)
- Langfuse Walkthrough - Full Demo of Agent Tracing, Evals, Experiments and Prompt Management影片 ・ Langfuse ・ 15 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
