跳到主要內容
AI 武林
文章入門EN

Stop Trusting MTEB Rankings (Kelly Hong, Chroma)

來源 Jason Liu(部落格)人物 Jason Liu

讀原文(在新分頁開啟原站)連到 Jason Liu(部落格)

摘要

Kelly Hong 與 Chroma 探討如何透過生成式基準測試,從使用者自身資料創造真實的評估集,以取代依賴通用公版基準(如 MTEB)的侷限。此方法透過 LLM 判讀與生成符合實際行為的查詢,測試嵌入模型在私有資料上的表現,避免模型僅為公版資料「死記硬背」。

Kelly Hong from Chroma discusses generative benchmarking to create custom evaluation sets from private data, replacing generic public benchmarks like MTEB. By using LLMs to generate realistic queries, this method reveals that high performance on public datasets does not guarantee good performance in…

重點

  • 使用 LLM 從私有資料生成真實查詢與判讀,取代通用公版基準。
  • 透過生成式基準測試,能發現模型在公版資料上的高排名不代表實際應用表現。
  • 結合 LLM 判讀與人工驗證,可精確識別無用內容並最佳化檢索管道。

提到的工具與公司

  • Chroma
  • Modal

適合誰看

建構垂直 AI 應用、開發檢索系統或需要深度評估嵌入模型效能的開發者。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.75
新鮮
0.23

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)