看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
李宏毅教授探討大型語言模型的可解釋性,透過實作實驗與理論分析,說明如何判斷模型是否透明、可解讀及可解釋。課程涵蓋開源與閉源模型的差異、探針分析(probing)方法、信心分數評估,以及模型可能編造解釋的風險,幫助讀者理解當前 AI 黑盒的邊界與分析工具。
This course explains how to analyze the internal reasoning of large language models, covering transparency, interpretability, and explainability through experiments and theoretical methods.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 大型語言模型雖非開源,但部分模型參數與訓練過程已公開。
- 透過探針分析與信心分數,可評估模型內部資訊與決策確信度。
- 模型提供的解釋未必真實,可能受提示影響而編造合理理由。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- GPT-4
- Llama
- Mistral
- Gemma
- Pythia
- OLMO
- Claude
適合誰看
正在學習機器學習原理、研究 AI 可解釋性,或希望深入理解大型語言模型運作機制的人。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.51
- 新鮮
- 0.03
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Interpretability: Understanding how AI models think影片 ・ Anthropic ・ 59 分鐘
- The Dark Matter of AI [Mechanistic Interpretability]影片 ・ Welch Labs ・ 24 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第14講:淺談大型語言模型相關的安全性議題 (下) — 欺騙大型語言模型影片 ・ Hung-yi Lee ・ 16 分鐘(在新分頁開啟原站)
- 【生成式人工智慧與機器學習導論2025】第 7 講:大型語言模型的學習歷程影片 ・ Hung-yi Lee ・ 1 小時 59 分(在新分頁開啟原站)
- 4 Philosophies of Interpretability影片 ・ Neel Nanda ・ 1 小時 30 分(在新分頁開啟原站)
- Understanding the inner thoughts of AI影片 ・ Google DeepMind ・ 53 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
