聽節目(在新分頁開啟原站)連到 OnBoard!
摘要
深度解析 Google DeepMind 與 OpenAI 的 o1 模型,探討其結合蒙特卡洛樹搜尋(MCTS)與強化學習(RL)的新技術。節目由 Google DeepMind 的 Kimiko Kong、Eric Li 以及前微信 AI 專家蘇輝共同主持,他們從理論到實踐,詳細解構了 o1 如何透過 MCTS 最佳化推理路徑,並重新訓練模型以達到類似博士生的邏輯推理水平。
This podcast provides a deep technical analysis of Google DeepMind's o1 model, highlighting its integration of Monte Carlo Tree Search (MCTS) and Reinforcement Learning (RL). Hosted by Google DeepMind researchers and industry experts, the episode details how these technologies enhance logical and in…
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- o1 結合 MCTS 與 RL 實現高階邏輯推理,接近博士生水平。
- Google DeepMind 與 Eric Li 提供 MCTS 在 LLM 推理中的核心技術。
- 蘇輝分享國內大模型訓練與 RLHF 經驗,對比中美技術視角。
章節
依話題轉折切分,標題由 AI 產生
- 00:00OpenAI O1 發布:結合強化學習與思維鏈的新範式
- 03:24RL 與 MCTS 在 LLM 中的融合:最佳化推理路徑
- 06:49過程監督資料:提升 RL 訓練效率的關鍵
- 09:56從 LLM 評估到 Agent:Google Ads 的實戰應用
- 13:19IDE 的重生:MIT 創始人與 AI 原生產品的崛起
- 28:04O1 的侷限與未來:資料覆蓋率與評估可擴展性
- 35:23複雜場景下的 Reasoning:私人秘書與旅行規劃
- 40:46資料驅動的能力:Stack Overflow 與 Wikipedia 的價值
- 1:08:01深度比寬度重要:標註資料的工程化挑戰
- 1:22:43RL 與 MCTS 的結合:策略搜尋與決策最佳化
- 1:40:11RL 的定義與潛力:從舊日回憶到複雜現實
- 1:58:24RL 的理論與實踐:窮舉法與有效解的平衡
- 2:41:54Agent 的未來:O1 取代額外總結與呼叫的場景
提到的工具與公司
- MCTS
- Google DeepMind
- OpenAI
- AlphaGo
- AlphaFold
適合誰看
對大語言模型技術細節感興趣的程式設計師、AI 研究者或科技業人士。
摘要依據
- 講者
- Monica Xie
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.06
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Eric Jang – Building AlphaGo from scratchPodcast ・ Dwarkesh Podcast ・ 2 小時 37 分
- EP 67. 解析DeepSeek R1技术创新与生态影响:强化学习,Long CoT,数据,Agent与开源生态Podcast ・ OnBoard! ・ 2 小時 49 分
- How OpenAI made o1 "think" – Here is what we think and already know about o1 reinforcement learning影片 ・ AI Coffee Break with Letitia ・ 9 分鐘(在新分頁開啟原站)
- 谷歌DeepMind掌舵人承认当前模型略逊于前沿 | Koray Kavukcuoglu | Gemini 4 | 3.5 Pro | AI前沿 | AGI | 强化学习 | 深度学习 |影片 ・ Best Partners TV ・ 17 分鐘(在新分頁開啟原站)
- Koray Kavukcuoglu on frontier models, coding agents, and building AGI影片 ・ Google for Developers ・ 27 分鐘(在新分頁開啟原站)
- ThursdAI - Aug 06 - Google shakeup, Details on OpenAI hack, 2 new agent harnesses, 4 video models (1 Open) and 3 guest segmentsPodcast ・ ThursdAI ・ 2 小時 4 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
