看影片(在新分頁開啟原站)連到 Neel Nanda
摘要
Neel Nanda 給 MATS 學員的演講,照他自己做過的研究回顧機制可解釋性(mechanistic interpretability)的發展史:早期的視覺模型與特徵視覺化、CNN 裡的電路分析、轉向 Transformer、grokking 與模加法、因果介入與 activation patching、IOI 電路、備援注意力頭,以及疊加(superposition)的難題。內容講到稀疏自編碼器(SAE)出現之前為止,之後的部分另外再講。
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
適合誰看
對機器學習模型內部運作與可解釋性有研究興趣的學者或工程師。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.23
- 新鮮
- 0.28
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Don't Go Quiet On Me (by Opus 5.5)影片 ・ Neel Nanda
- What Matters Right Now In Mechanistic Interpretability?影片 ・ Neel Nanda ・ 59 分鐘
- The Dark Matter of AI [Mechanistic Interpretability]影片 ・ Welch Labs ・ 24 分鐘
- Understanding the inner thoughts of AI影片 ・ Google DeepMind ・ 53 分鐘
- Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers影片 ・ Stanford Online ・ 1 小時 44 分
- Interpretability: Understanding how AI models think影片 ・ Anthropic ・ 59 分鐘
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
