影片進階中文2.7 萬 次觀看
【生成式AI時代下的機器學習(2025)】第九講:你這麽認這個評分系統幹什麽啊?談談有關大型語言模型評估的幾件事
看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
李宏毅教授探討如何公平評估大型語言模型的推論能力,指出傳統數學題集易被模型背答案或過擬合。影片介紹了 ARC-AGI 圖形推理測試集與 Chatbot Arena 人機對戰平台,並分析書寫風格如何影響評分。最後引用古德哈特定律,說明單一指標會導致模型行為異化,強調缺乏完美評量標準。
This lecture discusses the challenges of evaluating LLM reasoning, highlighting issues with benchmark overfitting and the influence of writing style on rankings like Goodhart's Law.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 數學題集易被模型背答案或過擬合,無法真實反映推論能力。
- ARC-AGI 圖形推理測試集較難背答案,但仍有被hack的風險。
- Chatbot Arena 評分受書寫風格影響,需考慮古德哈特定律。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- GSM8K
- ARC-AGI
- o1-mini
- o1-preview
- o1
- o3
- Claude
適合誰看
正在學習機器學習、大語言模型評估或想了解 AI 評量方法的學生與研究者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.46
- 新鮮
- 0.14
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 【生成式AI導論 2024】第12講:淺談檢定大型語言模型能力的各種方式影片 ・ Hung-yi Lee ・ 46 分鐘
- Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)文章 ・ Eugene Yan(部落格)
- 【生成式人工智慧與機器學習導論2025】第 4 講:評估生成式人工智慧能力時可能遇到的各種坑影片 ・ Hung-yi Lee ・ 2 小時 1 分
- Using LLM-as-a-Judge For Evaluation: A Complete Guide文章 ・ Hamel Husain(部落格)
- Weights & Biases LLM-Evaluator Hackathon - Hackathon Judge文章 ・ Eugene Yan(部落格)
- Are AI Evals Broken? Anthropic/NYU’s Pavel Izmailov on LLM Evaluation, Reasoning & “Alien” BehaviorPodcast ・ The MAD Podcast ・ 45 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
