跳到主要內容
AI 武林
影片高階中文912 次觀看

339期丨基于强化学习实现大语言模型并行思考Parallel-R1

來源 智源社区

看影片(在新分頁開啟原站)連到 Bilibili・智源社区

摘要

報告由美國馬裡蘭大學鄭童分享,介紹 Parallel-R1 框架,這是首個用於複雜現實世界推理任務的並行思維強化學習框架。該框架採用漸進式課程學習策略,解決現有方法依賴合成資料監督微調的挑戰,提升大型語言模型的推理能力。

This talk introduces Parallel-R1, a reinforcement learning framework for parallel thinking in large language models.

這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。

提到的工具與公司

  • Parallel-R1

適合誰看

適合有機器學習或大型語言模型基礎的研究人員與工程師。

摘要依據

依據
標題與說明欄(還沒有取得字幕或內文)

為什麼排在這裡

人氣
0.14
新鮮
0.37

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

這個來源最近的內容

智源社区 的所有內容

摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)