跳到主要內容
AI 武林
影片高階EN1,340 次觀看

Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 16: Fundamentals of RL

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

介紹強化學習的基礎設定,並深入探討如何利用互動來解決動態規劃無法處理的未知環境問題。內容涵蓋蒙特卡洛學習與時間差分學習,透過實際的黑jack遊戲範例,演示如何從互動中估算狀態價值並推匯出最佳策略。

This lecture introduces reinforcement learning fundamentals and demonstrates Monte Carlo and temporal difference learning using a blackjack example.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 介紹強化學習的基礎設定與蒙特卡洛、時間差分學習方法。
  • 透過黑jack遊戲範例,演示如何從互動中估算價值函式。
  • 說明強化學習的核心架構:取樣、價值估計/模型學習、策略最佳化。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:06從模仿學習轉向強化學習
  2. 03:37動態規劃與貝爾曼方程
  3. 15:07策略評估與策略改進步驟
  4. 19:20精確方法的限制與取樣近似
  5. 22:22蒙特卡洛方法的核心概念
  6. 25:57首次造訪與每次造訪策略
  7. 28:57無模型方法與黑箱模擬器
  8. 32:00黑傑克環境獎勵機制與策略假設
  9. 38:09蒙特卡洛與動態規劃結合的 TD 學習
  10. 54:42透過完整回合互動近似期望值
  11. 59:22無模型動態規劃與策略改進骨架
  12. 1:04:05利用樣本探索狀態行動空間
  13. 1:06:58無預設規則下匯出黑傑克最佳策略
  14. 1:10:06強化學習演算法的共同取樣骨架

適合誰看

正在學習機器學習理論或希望掌握強化學習基礎概念的學生與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.46
新鮮
0.82

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)