跳到主要內容
AI 武林
影片進階中文2.7 萬 次觀看

【生成式AI時代下的機器學習(2025)】第九講:你這麽認這個評分系統幹什麽啊?談談有關大型語言模型評估的幾件事

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

李宏毅教授探討如何公平評估大型語言模型的推論能力,指出傳統數學題集易被模型背答案或過擬合。影片介紹了 ARC-AGI 圖形推理測試集與 Chatbot Arena 人機對戰平台,並分析書寫風格如何影響評分。最後引用古德哈特定律,說明單一指標會導致模型行為異化,強調缺乏完美評量標準。

This lecture discusses the challenges of evaluating LLM reasoning, highlighting issues with benchmark overfitting and the influence of writing style on rankings like Goodhart's Law.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 數學題集易被模型背答案或過擬合,無法真實反映推論能力。
  • ARC-AGI 圖形推理測試集較難背答案,但仍有被hack的風險。
  • Chatbot Arena 評分受書寫風格影響,需考慮古德哈特定律。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00數學題測推論力,背答案也能得分
  2. 06:24ARC-AGI 圖形測驗,作者曾是 Keras 創始人
  3. 13:03Chatbot Arena 人海戰術,但人類偏好可被利用
  4. 16:01Elo 戰力分數計算,透過模型對戰勝率反推實力
  5. 19:25排除風格干擾變數,長度與 Emoji 數量影響排名
  6. 22:47古德哈特定律警示,評分系統會導致模型異化

提到的工具與公司

  • GSM8K
  • ARC-AGI
  • o1-mini
  • o1-preview
  • o1
  • o3
  • Claude

適合誰看

正在學習機器學習、大語言模型評估或想了解 AI 評量方法的學生與研究者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.46
新鮮
0.14

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)