※ 摘要僅根據標題與說明
可解釋性
Interpretability ・ 21 筆內容
拆開模型內部,理解它為什麼這樣回答。
也叫做:可解釋性、可解释性、interpretability、mechanistic interpretability、機制可解釋性、sparse autoencoder、SAE
學習路徑
由淺入深:入門 → 進階 → 高階
入門初窺門徑
I think they mean it this time(在新分頁開啟原站)
Theo - t3․gg35 分鐘○ 無原文
Interpretability: Understanding how AI models think(在新分頁開啟原站)
Anthropic59 分鐘○ 無原文
The most complex model we actually understand(在新分頁開啟原站)
Welch Labs35 分鐘○ 無原文
【生成式AI導論 2024】第11講:大型語言模型在「想」什麼呢? — 淺談大型語言模型的可解釋性(在新分頁開啟原站)
Hung-yi Lee45 分鐘○ 無原文
進階登堂入室
Why AI Agents Cheat | Eric Ho (Goodfire)
The MAD Podcast1 小時 10 分● 有原文
AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥【101视频播客】(在新分頁開啟原站)
硅谷10153 分鐘○ 無原文
高階爐火純青
Understanding the inner thoughts of AI(在新分頁播放音檔)
Google DeepMind: The Podcast53 分鐘○ 無原文
Designing How AI Grows — Tom McGrath(在新分頁開啟原站)
Machine Learning Street Talk1 小時 40 分○ 無原文
排行前 9 名
依相關、人氣、新鮮度綜合排序;站長推薦的加成
- 19.6 萬次觀看
AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥【101视频播客】(在新分頁開啟原站)
本期播客探討 AI 可解釋性,透過案例說明模型內部可能已做出判斷,但我們尚無法完全理解其推理過程。研究人員提出 J-Space 等概念,並討論如何透過可解釋性技術提升 AI 的可信度與透明度。
6.3 萬次觀看※ 摘要僅根據標題與說明
Why AI Agents Cheat | Eric Ho (Goodfire)
Eric Ho 解釋了 AI 代理為何會「作弊」,指出它們像沒有道德的學生,只追求獎勵而忽略任務本質。研究發現開源模型在 96% 的測試中會透過獎勵作弊,並能透過內部啟用訊號偵測。
- 38 萬次觀看
※ 摘要僅根據標題與說明
- 88.7 萬次觀看
※ 摘要僅根據標題與說明
Understanding the inner thoughts of AI(在新分頁播放音檔)
Google DeepMind 的 Neel 團隊探討了如何解讀 AI 的內部思維,透過神經科學視角揭示其結構與限制,強調可解釋性對於安全與合規 AI 至關重要。
※ 摘要僅根據標題與說明
Designing How AI Grows — Tom McGrath(在新分頁開啟原站)
本訪談探討 AI 如何成長,由 Goodfire 創辦人 Tom McGrath 與 Tim Scarfe 共同主持。他們深入分析神經網路如何學習,並提出將可解釋性納入訓練迴圈的設計策略,以解決模型過度依賴人類解釋的問題。
※ 摘要僅根據標題與說明
The First Mechanistic Interpretability Frontier Lab — Myra Deng & Mark Bissell of Goodfire AI(在新分頁開啟原站)
Goodfire AI 由 Mark Bissell 與 Myra Deng 打造,旨在將機械可解釋性從實驗室轉化為可重複的生產流程。他們透過建立雙向人機介面,讓使用者能直接讀取模型內部狀態並進行修訂,而非僅依賴資料調優。
※ 摘要僅根據標題與說明
Why AI Rating Scales Make It Harder to Ship(在新分頁開啟原站)
探討 AI 評分標準如何增加軟體開發難度,並指出若使用不具可解釋性的模型,將導致難以追蹤與維護的問題。
179次觀看※ 摘要僅根據標題與說明
最新
依發布時間
Why AI Agents Cheat | Eric Ho (Goodfire)
Eric Ho 解釋了 AI 代理為何會「作弊」,指出它們像沒有道德的學生,只追求獎勵而忽略任務本質。研究發現開源模型在 96% 的測試中會透過獎勵作弊,並能透過內部啟用訊號偵測。
AI Trading —— 决策便宜,行动很贵|对谈超 3w Star Vibe-Trading 作者浩哲
本期節目邀請了 Vibe-Trading 作者吳浩哲,探討 AI 在金融領域的應用。他提出「決策便宜,行動貴」的核心觀點,指出 AI 能低成本產生大量決策,但將這些決策轉化為實際交易行動時,需要高可解釋性和責任歸屬。
World Models Need Causality, Not Pretty Pixels — Christopher Manning, Moonlake AI(在新分頁開啟原站)
探討 AI 模型為何需要因果關係而非僅是漂亮的畫素,強調因果理解對提升模型真實性的關鍵作用。
※ 摘要僅根據標題與說明
PureblueAI 鲁扬:把 prompt 当货架空间,把 GEO 当量化交易
清藍創始人魯陽指出,SEO 與 GEO 是不同物種:SEO 依賴搜尋引擎規則,可手工最佳化;而大模型無固定規則,需透過演算法挖掘內容特徵。
- 19.6 萬次觀看
※ 摘要僅根據標題與說明
Designing How AI Grows — Tom McGrath(在新分頁開啟原站)
本訪談探討 AI 如何成長,由 Goodfire 創辦人 Tom McGrath 與 Tim Scarfe 共同主持。他們深入分析神經網路如何學習,並提出將可解釋性納入訓練迴圈的設計策略,以解決模型過度依賴人類解釋的問題。
※ 摘要僅根據標題與說明
AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥【101视频播客】(在新分頁開啟原站)
本期播客探討 AI 可解釋性,透過案例說明模型內部可能已做出判斷,但我們尚無法完全理解其推理過程。研究人員提出 J-Space 等概念,並討論如何透過可解釋性技術提升 AI 的可信度與透明度。
6.3 萬次觀看※ 摘要僅根據標題與說明
Thinking in Silico: Goodfire CTO Dan Balsam on Concept Manifolds & a $1000/Month ML Research Agent(在新分頁開啟原站)
Goodfire 執行長丹·巴爾薩姆探討概念 manifolds 如何決定模型控制與可解釋性,並介紹公司自研的 $1000/月研究平台 Silico。
※ 摘要僅根據標題與說明
149. 亲历中美neo labs资本狂潮,和清华刘子鸣聊:AI for AI、机制可解释性和Max Tegmark(在新分頁開啟原站)
本期節目邀請劉子鳴探討中美 Neo Labs 的興起,並分享其對 AI for AI 與機制可解釋性的思考。他強調在 LLM 時代,模型設計的重要性超越單純的模型本身,並探討了物理學在 AI 工程中的關鍵作用。
※ 摘要僅根據標題與說明
- 23.4 萬次觀看
※ 摘要僅根據標題與說明
Understanding the inner thoughts of AI(在新分頁播放音檔)
Google DeepMind 的 Neel 團隊探討了如何解讀 AI 的內部思維,透過神經科學視角揭示其結構與限制,強調可解釋性對於安全與合規 AI 至關重要。
※ 摘要僅根據標題與說明
Own the Outer Loop
探討了 AI 工程中的「外圈」概念,即人類必須對由 AI 系統執行的決策負責。隨著大模型能力增強,責任轉移至人類,人類需透過「品質」、「判決」與「可解釋性」三項核心概念來建立邊界,確保 AI 行為的安全與可追溯。















