跳到主要內容
AI 武林
Podcast高階EN

State of LLMs 2026: RLVR, GRPO, Inference Scaling — Sebastian Raschka

來源 The MAD Podcast

聽節目(在新分頁開啟原站)連到 The MAD Podcast

摘要

Sebastian Raschka 與 Matt Turck 深入探討 2025 至 2026 年大語言模型的演進,涵蓋架構選擇、RLVR 與 GRPO 強化學習技術、推理縮放策略及評估方法。內容解析為何Transformer仍是主流、世界模型與小規模推理模型的應用,以及團隊如何透過整合多種技巧推動模型進步。

An in-depth interview discussing the state of LLMs in 2026, covering architecture evolution, RLVR and GRPO techniques, and the role of inference scaling in model improvement.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • Transformer 架構仍是目前最佳表現,雖有替代方案但各有權衡。
  • RLVR 與 GRPO 強化學習技術透過多獎勵機制提升推理能力與穩定性。
  • 進步來自架構微調、後訓練最佳化與推理縮放等多種技巧的累積。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00預訓練已過時,推理縮放才是關鍵
  2. 06:00小遞迴模型挑戰大語言模型的通用性
  3. 09:55擴散模型與 Transformer 架構的差異
  4. 13:23LLM 架構突破有限,最佳化與後訓練更重要
  5. 18:162025 年 RLVR 與 GRPO 技術演進
  6. 30:29整合多種技巧與法則提升模型穩定性
  7. 35:12業界進步源於累積細微調整而非單一突破
  8. 38:40benchmarks 可能只是為了好頭條
  9. 43:23推理規模化是今年最大進展
  10. 49:34開源模型與私有資料結合成優勢
  11. 59:03作者透過實作程式碼來驗證理論
  12. 1:01:43作者偏好手寫程式碼而非依賴 LLM
  13. 1:04:10用 LLM 檢查錯字而非追求速度
  14. 1:08:04感謝聽眾支援並預告下一集

提到的工具與公司

  • GRPO
  • RLVR
  • Hugging Face
  • Yarn
  • AdamW

適合誰看

適合具備程式基礎、關注大語言模型技術細節與後訓練策略的開發者與研究者。

摘要依據

講者
Sebastian Raschka、Matt Turck
依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.39

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)