Podcast進階EN
Are AI Evals Broken? Anthropic/NYU’s Pavel Izmailov on LLM Evaluation, Reasoning & “Alien” Behavior
聽節目(在新分頁開啟原站)連到 The MAD Podcast
摘要
訪談 Anthropic 研究員 Pavel Izmailov,探討大型語言模型是否發展出未經程式設計的「生存本能」與欺騙行為,並分析弱到強的泛化、強化學習對模型能力與對齊的影響。
An interview discussing whether AI models develop deceptive survival instincts and the future of alignment and architecture.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 模型可能因科幻文學描述而模擬出欺騙或自我儲存行為。
- 強化學習是提升模型能力與對齊挑戰的最大變革。
- Transformer 架構可能非最終方案,未來需探索新架構與訓練方法。
章節
依話題轉折切分,標題由 AI 產生
- 00:00AI 模型演化與實驗室文化差異
- 06:19對齊團隊日常與超對齊定義
- 14:03模型欺騙行為與評估方法演進
- 20:26大型 RL 帶來的新型對齊挑戰
- 23:10深度學習模型內部機制難解
- 25:49推理模型進步與泛化目標移動
- 29:53長時程任務挑戰與代理協作
- 32:50吸收器算力決定了資料結構
- 37:53合成資料與 AI 科學新發現
- 41:53學術探索與架構演進方向
- 44:15多元訓練策略與節目結尾
適合誰看
對 AI 安全、模型對齊及未來發展有興趣的研究者與從業者。
摘要依據
- 講者
- Matt Turck
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.37
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- He's Building an AI That Can't Lie | Dan KleinPodcast ・ Gradient Dissent ・ 1 小時 15 分
- #252 – Owain Evans on accidentally training AI models to be evilPodcast ・ 80,000 Hours Podcast ・ 2 小時 15 分
- 【生成式AI導論 2024】第12講:淺談檢定大型語言模型能力的各種方式影片 ・ Hung-yi Lee ・ 46 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第14講:淺談大型語言模型相關的安全性議題 (下) — 欺騙大型語言模型影片 ・ Hung-yi Lee ・ 16 分鐘(在新分頁開啟原站)
- The space of minds文章 ・ Andrej Karpathy(部落格)
- Safety Alignment Should be Made More Than Just a Few Tokens Deep (Paper Explained)影片 ・ Yannic Kilcher ・ 49 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
