看影片(在新分頁開啟原站)連到 Bilibili・智源社区
摘要
報告由美國馬裡蘭大學鄭童分享,介紹 Parallel-R1 框架,這是首個用於複雜現實世界推理任務的並行思維強化學習框架。該框架採用漸進式課程學習策略,解決現有方法依賴合成資料監督微調的挑戰,提升大型語言模型的推理能力。
This talk introduces Parallel-R1, a reinforcement learning framework for parallel thinking in large language models.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- Parallel-R1
適合誰看
適合有機器學習或大型語言模型基礎的研究人員與工程師。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.14
- 新鮮
- 0.37
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- CMU LLM Inference (9): Reasoning Models影片 ・ Graham Neubig ・
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分 ・
- Agentic RL: Frameworks and Best Practices文章 ・ Deep (Learning) Focus(Cameron R. Wolfe) ・
- I trained (one of) the smallest Reasoning Language Models EVER from scratch影片 ・ Neural Breakdown with AVB ・
- Reinforcement Learning for LLMs: The Complete Guide文章 ・ Deep (Learning) Focus(Cameron R. Wolfe) ・
- Build A Reasoning Model From Scratch 6: Reinforcement Learning 1 (Implementing GRPO for RLVR)影片 ・ Sebastian Raschka ・
這個來源最近的內容
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
