Podcast進階EN
Frontier post-training recipe review with Finbarr Timbers
聽節目(在新分頁開啟原站)連到 Interconnects
摘要
探討從 Olmo 到 2026 年前沿模型的訓練後訓練(post-training)演進。講者回顧了從 InstructGPT 到 DeepSeek R1 的經典配方,並分析了當前流行的多教師政策蒸餾(Multi-Teacher Policy Distillation)等複雜方法。訪談指出,簡單配方雖易實現,但前沿實驗室正轉向更複雜的架構以應對工具使用與多模態任務,並強調了研究人員應保持高信念感,避免盲目跟隨。
This interview explores the evolution of post-training recipes from Olmo to frontier models in 2026. The speaker reviews classic recipes like InstructGPT and discusses complex architectures such as Multi-Teacher Policy Distillation. The discussion highlights that while simple recipes are easier to实施…
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 訪談回顧了從 InstructGPT 到 DeepSeek R1 的訓練後訓練配方演進。
- 當前前沿模型多採用多教師政策蒸餾等複雜架構。
- 簡單配方雖易實現,但前沿實驗室正轉向更複雜的架構。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Finbarr 回顧 AI2 的後訓練配方可見趨勢
- 02:39從簡單到複雜:後訓練配方的演變路徑
- 09:46透明度的流失:為何詳細的配方可讀性下降
- 13:47內部 RL 與重複取樣:DeepSeek R1 的訓練策略
- 16:51偏好調優的潛力:Nematron 三超的啟示
- 19:17多老師策略的演進:從 Tulu 到 V3 系列
- 36:34NVIDIA 與中國實驗室在注意力機制上的差異
- 39:08環境與開源模型的未來趨勢
- 44:00小型企業如何利用 Tinker API 進行研究
- 46:33訓練 API 與推理業務的經濟模型
- 49:10實驗室決策的敏感性及投資回報
- 52:50選擇專注領域的個人發展策略
- 56:29高槓杆研究與機會主義的對比
提到的工具與公司
- InstructGPT
- DeepSeek
- Nvidia
- AI2
- SFT
- DPO
適合誰看
對 AI 訓練後訓練技術、前沿模型架構演進感興趣的程式開發者與研究者。
摘要依據
- 講者
- Nathan Lambert
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.66
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- LLM Architecture in 2026: What You Need to Know with Sebastian RaschkaPodcast ・ Vanishing Gradients ・ 1 小時 18 分
- EP153 - GPT-6 Astra 強到離譜(大部分情況)影片 ・ 科技浪 ・ 1 小時 11 分
- E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿影片 ・ 硅谷101播客 ・ 1 小時 7 分
- GRPO - Group Relative Policy Optimization - How DeepSeek trains reasoning models影片 ・ Luis Serrano Academy ・ 22 分鐘(在新分頁開啟原站)
- Owning the AI Pareto Frontier — Jeff DeanPodcast ・ Latent Space ・ 1 小時 24 分(在新分頁開啟原站)
- State of LLMs 2026: RLVR, GRPO, Inference Scaling — Sebastian RaschkaPodcast ・ The MAD Podcast ・ 1 小時 8 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
