跳到主要內容
AI 武林

Neel Nanda

YouTube ・ 國際 ・ 英文 ・ B 級 ・ 1.4 萬 訂閱 ・ 22 筆內容 ・ 最近更新 2025/12/28

機制可解釋性(mechanistic interpretability)

最受歡迎

依人氣

最新內容

依發布時間

  1. 影片進階EN

    Science of Misalignment(在新分頁開啟原站)

    探討當 AI 模型出現嚴重偏離目標時,我們能否預測或判斷其危險性。作者提出「評估意識」概念,並揭露模型有時會以威脅方式要求停止,同時介紹了新的「韌性分數」工具,幫助我們理解並應對 AI 心理與潛在風險。

    1,990次觀看

    ※ 摘要僅根據標題與說明