看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
介紹如何評估大型語言模型的能力,涵蓋選擇題、翻譯、長文閱讀等任務的評比方法。內容指出傳統基準如 MMLU、BLEU 存在缺陷,並探討模型可能偷看訓練資料的現象,提供更客觀的評估視角。
This video explains various methods to evaluate large language model capabilities, including benchmarks and potential data leakage issues.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 語言模型能力評估需考慮選項擺放、輸出限制等變數影響。
- 傳統基準如 BLEU 與 MMLU 存在瑕疵,人類評比亦非絕對準確。
- 模型可能偷看訓練資料,導致在特定測試集上表現異常。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- MMLU
- BLEU
- ROUGE
- GPT-4
- Llama
適合誰看
正在學習機器學習、開發大型語言模型或需要評估 AI 能力的讀者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.48
- 新鮮
- 0.03
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Understanding the 4 Main Approaches to LLM Evaluation (From Scratch)文章 ・ Sebastian Raschka(部落格)
- Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)文章 ・ Eugene Yan(部落格)
- 【生成式AI時代下的機器學習(2025)】第九講:你這麽認這個評分系統幹什麽啊?談談有關大型語言模型評估的幾件事影片 ・ Hung-yi Lee ・ 24 分鐘(在新分頁開啟原站)
- Going In Deep On Data | YC Paper Club影片 ・ Y Combinator ・ 53 分鐘(在新分頁開啟原站)
- Task-Specific LLM Evals that Do & Don't Work文章 ・ Eugene Yan(部落格)
- 【生成式AI導論 2024】第13講:淺談大型語言模型相關的安全性議題 (上) — 亡羊補牢、語言模型的偏見、有多少人用 ChatGPT 寫論文審查意見影片 ・ Hung-yi Lee ・ 32 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
