影片高階EN1,340 次觀看
Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 16: Fundamentals of RL
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
介紹強化學習的基礎設定,並深入探討如何利用互動來解決動態規劃無法處理的未知環境問題。內容涵蓋蒙特卡洛學習與時間差分學習,透過實際的黑jack遊戲範例,演示如何從互動中估算狀態價值並推匯出最佳策略。
This lecture introduces reinforcement learning fundamentals and demonstrates Monte Carlo and temporal difference learning using a blackjack example.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 介紹強化學習的基礎設定與蒙特卡洛、時間差分學習方法。
- 透過黑jack遊戲範例,演示如何從互動中估算價值函式。
- 說明強化學習的核心架構:取樣、價值估計/模型學習、策略最佳化。
章節
依話題轉折切分,標題由 AI 產生
適合誰看
正在學習機器學習理論或希望掌握強化學習基礎概念的學生與研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.46
- 新鮮
- 0.82
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 19: Model-Based RL影片 ・ Stanford Online ・ 1 小時 22 分(在新分頁開啟原站)
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 17: RL Value-Based Methods影片 ・ Stanford Online ・ 1 小時 18 分
- 人工智慧:機器學習與理論基礎 05. Reinforcement learning影片 ・ NTU OpenCourseWare ・ 2 小時 16 分(在新分頁開啟原站)
- MIT 6.S191 (2024): Reinforcement Learning影片 ・ Alexander Amini ・ 1 小時(在新分頁開啟原站)
- MIT 6.S191: Reinforcement Learning影片 ・ Alexander Amini ・ 59 分鐘(在新分頁開啟原站)
- Curriculum for Reinforcement Learning文章 ・ Lilian Weng(部落格)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
