跳到主要內容
AI 武林
影片進階EN509 次觀看

Simon Obstbaum & Rob Willoughby - Why evals are hard and how we're solving it - AI Native DevCon Jun

來源 AI Native Dev

看影片(在新分頁開啟原站)連到 AI Native Dev

摘要

演講者 Simon Obstbaum 與 Rob Willoughby 探討如何評估 AI 代理的實際行為,區分僅看輸出結果與追蹤完整執行軌跡(trajectory evals)的差異。透過 Stanford 大規模研究與 Tessl 工具,展示如何透過真實追蹤資料與機器學習模型,更精準地衡量 AI 工程師的生產力與代理效能。

Speakers discuss evaluating AI agent behavior through trajectory evals and real trace data to measure productivity and performance accurately.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 區分輸出評估與軌跡評估,能發現代理是否真正遵循指令。
  • 透過大規模研究發現,會編寫代理的人生產力顯著高於他人。
  • 利用真實追蹤資料與機器學習模型,更精準衡量代理效能。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00展示 Granola 技能庫與查詢功能
  2. 02:49探討 AI 採用率與工程師績效宏觀資料
  3. 07:16分析 AI 使用對團隊產出差異的影響
  4. 10:48解讀頂尖工程師角色轉變與績效曲線
  5. 19:42說明開發代理所需的結構化資訊與規範
  6. 22:04討論最佳化提示詞預算與安全合規策略
  7. 26:06回應關於資深工程師 productivity 轉變之問
  8. 30:45模型執行環境與資料公開重要性
  9. 36:15效能管理工具與程式碼品質探討

提到的工具與公司

  • Tessl
  • Stanford SEPR Lab
  • Claude Code
  • Cursor
  • Gemini
  • IEEE Automation Software Engineering

適合誰看

負責開發 AI 代理、需要評估系統效能或最佳化生產力的軟體工程師。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.23
新鮮
0.76

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)