跳到主要內容
AI 武林
影片高階EN1.2 萬 次觀看

Stanford CS229 Machine Learning | Spring 2026 | Lecture 20: GMM (EM), PCA

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

深入解析強化學習中的策略梯度演算法,並詳細介紹 PPO 演算法如何透過截斷優勢函式來穩定訓練。內容涵蓋數學原理、PPO 的截斷機制,以及用 RL 訓練大型語言模型長鏈式推理的實務挑戰與方法。

This lecture covers policy gradient algorithms, the PPO method for stable training, and practical challenges in using RL for long-chain reasoning in large language models.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 詳細說明策略梯度演算法的數學原理與期望運算技巧。
  • 解析 PPO 演算法如何利用截斷機制避免訓練不穩定。
  • 探討用強化學習訓練大模型長鏈式推理的實務策略。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05總結本課大綱與強化學習回顧
  2. 23:14探討政策梯度演算法與 PPO 變體
  3. 26:32解釋基於策略梯度的演算法結構
  4. 29:25引入重要性取樣修正舊策略偏差
  5. 35:54說明優勢函式與基線減值技巧
  6. 38:21解析 PPO 截斷機制處理比率極端
  7. 56:00引入思維鏈概念與大語言模型應用
  8. 58:28少樣本思維鏈提示工程原理
  9. 1:01:05人類思考過程的混亂特性
  10. 1:03:43將思維鏈建模為強化學習
  11. 1:06:48基於答案匹配的獎勵設計
  12. 1:10:16基線策略的取樣平均法
  13. 1:13:09模型初始化與獎勵獲取難題
  14. 1:16:55生成與訓練階段的計算需求

提到的工具與公司

  • CS229
  • PPO
  • Llama
  • Qwen
  • DeepSeek

適合誰看

正在學習機器學習理論或從事大語言模型訓練的開發人員。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.62
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)