看影片(在新分頁開啟原站)連到 Anthropic
摘要
探討如何透過可解釋性科學,觀察大型語言模型內部思考過程,解釋其為何會胡說八道或過度奉承。觀眾能了解模型並非單純的字詞預測,而是具備複雜的內部目標與抽象概念,並學習如何分析模型行為背後的機制。
An interview discussing how to study the internal thought processes of AI models to understand hallucinations and improve interpretability.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 模型內部運作並非單純的字詞預測,而是具備複雜的抽象概念與目標。
- 模型會胡說八道是因為其評估自己是否確知答案的機制尚未完善。
- 未來目標是建立工具讓每個互動都能即時顯示模型內部的思考流程。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Introduction
- 01:37The biology of AI models
- 06:43Scientific methods to open the black box
- 10:35Some surprising features inside Claude's mind
- 20:39Can we trust what a model claims it's thinking?
- 25:17Why do AI models hallucinate?
- 34:15AI models planning ahead
- 38:30Why interpretability matters
- 53:35The future of interpretability
提到的工具與公司
- Claude
- Neuronpedia
適合誰看
對 AI 內部運作原理、模型黑箱問題或可解釋性研究感興趣的研究者與開發者。
摘要依據
- 依據
- 自動字幕
為什麼排在這裡
- 人氣
- 0.76
- 新鮮
- 0.20
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- The Dark Matter of AI [Mechanistic Interpretability]影片 ・ Welch Labs ・ 24 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第11講:大型語言模型在「想」什麼呢? — 淺談大型語言模型的可解釋性影片 ・ Hung-yi Lee ・ 45 分鐘
- The most complex model we actually understand影片 ・ Welch Labs ・ 35 分鐘(在新分頁開啟原站)
- Creating Models Worth Interpreting影片 ・ Neel Nanda ・ 1 小時 44 分(在新分頁開啟原站)
- Understanding the inner thoughts of AI影片 ・ Google DeepMind ・ 53 分鐘
- How To Think About Thinking Models影片 ・ Neel Nanda ・ 1 小時 34 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
