跳到主要內容
AI 武林
影片入門中文6.6 萬 次觀看

【生成式人工智慧與機器學習導論2025】第 4 講:評估生成式人工智慧能力時可能遇到的各種坑

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

介紹如何評估生成式人工智慧的能力,涵蓋使用 Benchmark 與 Evaluation Metric 的方法、Exact Match 的侷限、以及考量速度、成本與安全性等面向。學員將了解如何設計指標來比較不同模型,並認識潛在的攻擊與偏見問題。

This lecture explains how to evaluate generative AI capabilities using benchmarks, metrics, and considerations like speed, cost, and security.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 評估模型需使用 Benchmark 與 Evaluation Metric 比較表現。
  • Exact Match 僅適用於選擇題,對生成式 AI 有重大侷限。
  • 除內容外,還需考量速度、成本、安全性與偏見等面向。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00評估生成式 AI 能力的重要性與 Benchmark 概念
  2. 11:39BLEU 與 ROUGE 等基於詞彙共用的評估指標
  3. 16:46Goodhart 定律與過度最佳化評估指標的陷阱
  4. 23:54過度信任分數導致幻覺與人類評量的挑戰
  5. 34:20人類評量中的偏見與訓練通用批評模型的策略
  6. 1:13:36語言模型西洋棋比賽與規則遵循能力的測試
  7. 1:18:12情境風險對模型回答保守度與不回答決策的影響
  8. 1:22:42Claude 長文大海撈針測試表現不佳
  9. 1:25:30Prompt 設計大幅影響模型評量結果
  10. 1:31:17GSM8K 測試資料洩漏與背誦問題
  11. 1:35:33模型內心汙穢但會偽裝成好孩子
  12. 1:45:19繞彎與偽裝身份可成功 Jailbreak
  13. 1:49:56威脅無效而道理說服力最強
  14. 2:00:42總結評估指標、資料洩漏與偏見

提到的工具與公司

  • GPT5
  • Gemini CLI

適合誰看

正在學習機器學習、開發 AI 系統或需要選擇合適人工智慧的讀者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.58
新鮮
0.26

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)