讀原文(在新分頁開啟原站)連到 Jason Liu(部落格)
摘要
Kelly Hong 與 Chroma 探討如何透過生成式基準測試,從使用者自身資料創造真實的評估集,以取代依賴通用公版基準(如 MTEB)的侷限。此方法透過 LLM 判讀與生成符合實際行為的查詢,測試嵌入模型在私有資料上的表現,避免模型僅為公版資料「死記硬背」。
Kelly Hong from Chroma discusses generative benchmarking to create custom evaluation sets from private data, replacing generic public benchmarks like MTEB. By using LLMs to generate realistic queries, this method reveals that high performance on public datasets does not guarantee good performance in…
重點
- 使用 LLM 從私有資料生成真實查詢與判讀,取代通用公版基準。
- 透過生成式基準測試,能發現模型在公版資料上的高排名不代表實際應用表現。
- 結合 LLM 判讀與人工驗證,可精確識別無用內容並最佳化檢索管道。
提到的工具與公司
- Chroma
- Modal
適合誰看
建構垂直 AI 應用、開發檢索系統或需要深度評估嵌入模型效能的開發者。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.23
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Are LLM Performance Benchmarks Reliable? — Ashok Chandrasekar & Jason Kramberger, Google影片 ・ AI Engineer ・ 16 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第12講:淺談檢定大型語言模型能力的各種方式影片 ・ Hung-yi Lee ・ 46 分鐘(在新分頁開啟原站)
- 【生成式AI時代下的機器學習(2025)】第九講:你這麽認這個評分系統幹什麽啊?談談有關大型語言模型評估的幾件事影片 ・ Hung-yi Lee ・ 24 分鐘(在新分頁開啟原站)
- AI Engineer 2023 Keynote - Building Blocks for LLM Systems文章 ・ Eugene Yan(部落格)
- Weights & Biases LLM-Evaluator Hackathon - Hackathon Judge文章 ・ Eugene Yan(部落格)
- Understanding the 4 Main Approaches to LLM Evaluation (From Scratch)文章 ・ Sebastian Raschka(部落格)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)
