影片高階EN1.2 萬 次觀看
Stanford CS229 Machine Learning | Spring 2026 | Lecture 20: GMM (EM), PCA
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
深入解析強化學習中的策略梯度演算法,並詳細介紹 PPO 演算法如何透過截斷優勢函式來穩定訓練。內容涵蓋數學原理、PPO 的截斷機制,以及用 RL 訓練大型語言模型長鏈式推理的實務挑戰與方法。
This lecture covers policy gradient algorithms, the PPO method for stable training, and practical challenges in using RL for long-chain reasoning in large language models.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 詳細說明策略梯度演算法的數學原理與期望運算技巧。
- 解析 PPO 演算法如何利用截斷機制避免訓練不穩定。
- 探討用強化學習訓練大模型長鏈式推理的實務策略。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- CS229
- PPO
- Llama
- Qwen
- DeepSeek
適合誰看
正在學習機器學習理論或從事大語言模型訓練的開發人員。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.62
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CS229 Machine Learning | Spring 2026 | Lecture 16: Basic Concept in RL, Policy Gradient影片 ・ Stanford Online ・ 1 小時 13 分
- Policy Gradient Algorithms文章 ・ Lilian Weng(部落格)
- GLM-5.2: DeepSeek Was Wrong About RL?影片 ・ bycloud ・ 16 分鐘(在新分頁開啟原站)
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 18: RL Policy Optimization影片 ・ Stanford Online ・ 1 小時 20 分(在新分頁開啟原站)
- Training Agents 3: Reinforcement Learning影片 ・ Hugging Face ・ 1 小時 17 分(在新分頁開啟原站)
- 【生成式AI導論 2024】第8講:大型語言模型修練史 — 第三階段: 參與實戰,打磨技巧 (Reinforcement Learning from Human Feedback, RLHF)影片 ・ Hung-yi Lee ・ 37 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
