看影片(在新分頁開啟原站)連到 YouTube・Hamel Husain
摘要
探討如何正確評估搜尋代理,指出傳統準確率指標無法反映搜尋效率與策略。透過 BrowseComp 等工具與軌跡分析,揭示模型與檢索器對分數的影響,並說明為何排行榜頂端模型往往效率最低。
This talk explains how to properly evaluate search agents beyond simple accuracy scores, revealing hidden inefficiencies in top-performing models.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- BrowseComp
- BEIR
- MIRACL
- TREC RAG
- FreshStack
適合誰看
正在開發或最佳化搜尋代理與檢索增強生成系統的開發者與研究人員。
摘要依據
- 講者
- Hamel Husain
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.44
- 新鮮
- 0.87
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Episode 68: A Builder’s Guide to Agentic Search & Retrieval with Doug Turnbull & John BerrymanPodcast ・ Vanishing Gradients ・ 1 小時 29 分
- Agentic Search: 搜尋技術不會消失,只是變成 Agent 工具文章 ・ ihower(張文鈿)
- #733.BM25 在智能体搜索中出人意料的有效性,简单工具为何重新变强Podcast ・ 跨国串门儿计划 ・ 18 分鐘
- Agentic Search vs Vector Search for Coding Agents: We Ran the Eval — Braintrust影片 ・ AI Engineer
- Simon Obstbaum & Rob Willoughby - Why evals are hard and how we're solving it - AI Native DevCon Jun影片 ・ AI Native Dev ・ 37 分鐘
- Evals for taste: Hill-climbing a slide-generation agent影片 ・ Claude ・ 39 分鐘
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
