跳到主要內容
AI 武林
影片高階EN1,428 次觀看

Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 17: RL Value-Based Methods

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

深入介紹機器學習控制中的無模型強化學習價值基方法,涵蓋 Sarsa 與 Q-learning 等演算法。內容解析了線上與離線演算法的差異,並說明如何利用經驗重放與目標網路穩定化技術,解決深度強化學習中的相關性與穩定性問題。

This lecture covers value-based reinforcement learning methods like Sarsa and Q-learning, explaining their differences and practical solutions for stability in deep reinforcement learning.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 介紹 Sarsa 與 Q-learning 等無模型價值基強化學習演算法。
  • 解釋線上與離線演算法在策略學習與表現上的關鍵差異。
  • 說明經驗重放與目標網路如何解決深度強化學習的穩定性問題。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05回顧學習控制路線圖與基礎概念
  2. 02:36介紹蒙特卡洛與時差學習原理
  3. 06:26說明通用策略迭代控制框架
  4. 12:24定義 Sarsa 演算法與時差更新
  5. 15:31透過風向環境演算 Sarsa 邏輯
  6. 20:12分析蒙特卡洛方法在該環境之限制
  7. 23:15釐清 Sarsa 為同策略學習演算法
  8. 26:31離線評估與行為策略解耦的優勢
  9. 31:11Q 學習中目標策略與行為策略的定義
  10. 45:36高維狀態空間下的函式逼近必要性
  11. 48:47參數化值函式如何緩解記憶與維度災難
  12. 56:29最小化均方誤差以學習值函式參數
  13. 1:09:13序列相關與移動目標帶來的穩定性挑戰
  14. 1:14:02目標網路延遲更新機制確保訓練穩定

適合誰看

適合具備程式基礎、正在學習機器學習或強化學習原理的學生與工程師。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.46
新鮮
0.82

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)