聽節目(在新分頁開啟原站)連到 The MAD Podcast
摘要
Sebastian Raschka 與 Matt Turck 深入探討 2025 至 2026 年大語言模型的演進,涵蓋架構選擇、RLVR 與 GRPO 強化學習技術、推理縮放策略及評估方法。內容解析為何Transformer仍是主流、世界模型與小規模推理模型的應用,以及團隊如何透過整合多種技巧推動模型進步。
An in-depth interview discussing the state of LLMs in 2026, covering architecture evolution, RLVR and GRPO techniques, and the role of inference scaling in model improvement.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- Transformer 架構仍是目前最佳表現,雖有替代方案但各有權衡。
- RLVR 與 GRPO 強化學習技術透過多獎勵機制提升推理能力與穩定性。
- 進步來自架構微調、後訓練最佳化與推理縮放等多種技巧的累積。
章節
依話題轉折切分,標題由 AI 產生
- 00:00預訓練已過時,推理縮放才是關鍵
- 06:00小遞迴模型挑戰大語言模型的通用性
- 09:55擴散模型與 Transformer 架構的差異
- 13:23LLM 架構突破有限,最佳化與後訓練更重要
- 18:162025 年 RLVR 與 GRPO 技術演進
- 30:29整合多種技巧與法則提升模型穩定性
- 35:12業界進步源於累積細微調整而非單一突破
- 38:40benchmarks 可能只是為了好頭條
- 43:23推理規模化是今年最大進展
- 49:34開源模型與私有資料結合成優勢
- 59:03作者透過實作程式碼來驗證理論
- 1:01:43作者偏好手寫程式碼而非依賴 LLM
- 1:04:10用 LLM 檢查錯字而非追求速度
- 1:08:04感謝聽眾支援並預告下一集
提到的工具與公司
- GRPO
- RLVR
- Hugging Face
- Yarn
- AdamW
適合誰看
適合具備程式基礎、關注大語言模型技術細節與後訓練策略的開發者與研究者。
摘要依據
- 講者
- Sebastian Raschka、Matt Turck
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.39
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- The State Of LLMs 2025: Progress, Problems, and Predictions文章 ・ Sebastian Raschka(部落格)
- LLM Architecture in 2026: What You Need to Know with Sebastian RaschkaPodcast ・ Vanishing Gradients ・ 1 小時 18 分
- Controlling Reasoning Effort in LLMs文章 ・ Sebastian Raschka(部落格)
- AI Trends 2026: OpenClaw Agents, Reasoning LLMs, and More with Sebastian Raschka - #762Podcast ・ The TWIML AI Podcast ・ 1 小時 19 分
- Build A Reasoning Model From Scratch 4: Inference Scaling 1 (Temperature, Top-p, Self-Consistency)影片 ・ Sebastian Raschka ・ 1 小時 37 分(在新分頁開啟原站)
- #490 – State of AI in 2026: LLMs, Coding, Scaling Laws, China, Agents, GPUs, AGIPodcast ・ Lex Fridman Podcast
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
