看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
介紹如何評估生成式人工智慧的能力,涵蓋使用 Benchmark 與 Evaluation Metric 的方法、Exact Match 的侷限、以及考量速度、成本與安全性等面向。學員將了解如何設計指標來比較不同模型,並認識潛在的攻擊與偏見問題。
This lecture explains how to evaluate generative AI capabilities using benchmarks, metrics, and considerations like speed, cost, and security.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 評估模型需使用 Benchmark 與 Evaluation Metric 比較表現。
- Exact Match 僅適用於選擇題,對生成式 AI 有重大侷限。
- 除內容外,還需考量速度、成本、安全性與偏見等面向。
章節
依話題轉折切分,標題由 AI 產生
- 00:00評估生成式 AI 能力的重要性與 Benchmark 概念
- 11:39BLEU 與 ROUGE 等基於詞彙共用的評估指標
- 16:46Goodhart 定律與過度最佳化評估指標的陷阱
- 23:54過度信任分數導致幻覺與人類評量的挑戰
- 34:20人類評量中的偏見與訓練通用批評模型的策略
- 1:13:36語言模型西洋棋比賽與規則遵循能力的測試
- 1:18:12情境風險對模型回答保守度與不回答決策的影響
- 1:22:42Claude 長文大海撈針測試表現不佳
- 1:25:30Prompt 設計大幅影響模型評量結果
- 1:31:17GSM8K 測試資料洩漏與背誦問題
- 1:35:33模型內心汙穢但會偽裝成好孩子
- 1:45:19繞彎與偽裝身份可成功 Jailbreak
- 1:49:56威脅無效而道理說服力最強
- 2:00:42總結評估指標、資料洩漏與偏見
提到的工具與公司
- GPT5
- Gemini CLI
適合誰看
正在學習機器學習、開發 AI 系統或需要選擇合適人工智慧的讀者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.58
- 新鮮
- 0.26
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 【生成式AI時代下的機器學習(2025)】第九講:你這麽認這個評分系統幹什麽啊?談談有關大型語言模型評估的幾件事影片 ・ Hung-yi Lee ・ 24 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第13講:淺談大型語言模型相關的安全性議題 (上) — 亡羊補牢、語言模型的偏見、有多少人用 ChatGPT 寫論文審查意見影片 ・ Hung-yi Lee ・ 32 分鐘
- Stop Trusting MTEB Rankings (Kelly Hong, Chroma)文章 ・ Jason Liu(部落格)
- AI Evals: Everything You Need to Know文章 ・ Hamel Husain(部落格)
- Patterns for Building Cybersecurity Evals文章 ・ Eugene Yan(部落格)
- Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weights影片 ・ IndyDevDan ・ 39 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
