跳到主要內容
AI 武林
影片進階中文2,925 次觀看

大模型强化学习一次讲透:RLHF、DPO、GRPO、RLVR 到底怎么选?

來源 唐国梁Tommy

看影片(在新分頁開啟原站)連到 Bilibili・唐国梁Tommy

摘要

以「程式碼修復 Agent」為案例,解釋大模型完成 SFT 後為何仍需強化學習,並釐清 RLHF、DPO、GRPO 等方法的差異與適用情境。觀眾將掌握針對工程實作選擇合適對齊策略的判斷力。

This video explains why reinforcement learning is needed after SFT for large models, using a code repair agent case to compare RLHF, DPO, GRPO, and RLVR.

這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。

適合誰看

正在進行大模型後訓練、開發 Agent 工程或研究強化學習對齊的技術人員。

摘要依據

依據
標題與說明欄(還沒有取得字幕或內文)

為什麼排在這裡

人氣
0.17
新鮮
0.63

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)