跳到主要內容
AI 武林
影片進階EN4,781 次觀看

Stanford CS229 Machine Learning | Spring 2026 | Lecture 18: GMM (EM), PCA

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

介紹強化學習基礎,解釋序列決策、獎勵機制與探索利用的平衡。透過馬可夫決策過程模型,詳細說明策略梯度演算法的數學原理與計算方法,讓讀者理解如何用試錯法訓練機器人或大語言模型。

This lecture introduces the fundamentals of reinforcement learning, covering sequential decision-making, reward mechanisms, and the policy gradient algorithm within the Markov decision process framework.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 強化學習透過獎勵訊號在無監督環境中學習序列決策。
  • 策略梯度演算法利用試錯法最佳化行動策略以最大化長期回報。
  • 馬可夫決策過程是描述環境與行動互動的核心數學框架。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05強化學習基礎與機器人應用
  2. 03:58探索與利用的權衡與無監督特性
  3. 07:44馬可夫決策過程與執行範例
  4. 12:11狀態遷移動力學與機率分佈
  5. 30:06連續狀態空間與實際定義
  6. 33:07馬可夫性質與最佳策略決定性
  7. 39:04策略函式與隨機策略的平滑動態
  8. 44:12利用遞迴關係計算無限級數和
  9. 47:06將總期望報酬拆解為狀態序列
  10. 50:46建立線性方程組求解價值函式
  11. 54:07針對隨機策略定義神經網路參數化
  12. 57:23透過梯度下降最佳化策略參數
  13. 1:00:17利用對數變換處理期望中的梯度
  14. 1:14:25以樣本平均估算無法列舉的期望

適合誰看

正在學習機器學習理論、機器人控制或大語言模型訓練的學生與工程師。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.54
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)