看影片(在新分頁開啟原站)連到 Bilibili・AITIME论道
摘要
報告探討擴散語言模型在推理任務上「任意順序生成」的價值邊界,發現其反而會縮窄模型能力。講者提出「靈活性陷阱」概念,並介紹 JustGRPO 方法來解決此問題。
This talk reveals that arbitrary-order generation in diffusion language models narrows reasoning capabilities due to a flexibility trap, introducing JustGRPO as a solution.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- dLLM
- JustGRPO
適合誰看
適合對大型語言模型推理機制與 RL 後訓練有興趣的研究者與工程師。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.25
- 新鮮
- 0.74
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- State of LLMs 2026: RLVR, GRPO, Inference Scaling — Sebastian RaschkaPodcast ・ The MAD Podcast ・ 1 小時 8 分 ・
- The Race to Production-Grade Diffusion LLMs with Stefano Ermon - #764Podcast ・ The TWIML AI Podcast ・ 1 小時 3 分 ・
- ICML oral/spotlight | 大模型数据策略、信任机制与扩散语言模型方向影片 ・ AITIME论道 ・ 2 小時 3 分 ・
- The Evolution of Reasoning in Small Language Models with Yejin Choi - #761Podcast ・ The TWIML AI Podcast ・ 1 小時 6 分 ・
- Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon影片 ・ No Priors ・
- RLMs are Compositional Generalizers with Alex Zhang from MIT影片 ・ Deep Learning with Yacine ・
這個來源最近的內容
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
