影片高階EN1,428 次觀看
Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 17: RL Value-Based Methods
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
深入介紹機器學習控制中的無模型強化學習價值基方法,涵蓋 Sarsa 與 Q-learning 等演算法。內容解析了線上與離線演算法的差異,並說明如何利用經驗重放與目標網路穩定化技術,解決深度強化學習中的相關性與穩定性問題。
This lecture covers value-based reinforcement learning methods like Sarsa and Q-learning, explaining their differences and practical solutions for stability in deep reinforcement learning.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 介紹 Sarsa 與 Q-learning 等無模型價值基強化學習演算法。
- 解釋線上與離線演算法在策略學習與表現上的關鍵差異。
- 說明經驗重放與目標網路如何解決深度強化學習的穩定性問題。
章節
依話題轉折切分,標題由 AI 產生
適合誰看
適合具備程式基礎、正在學習機器學習或強化學習原理的學生與工程師。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.46
- 新鮮
- 0.82
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 19: Model-Based RL影片 ・ Stanford Online ・ 1 小時 22 分(在新分頁開啟原站)
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 16: Fundamentals of RL影片 ・ Stanford Online ・ 1 小時 14 分
- MIT 6.S191: Reinforcement Learning影片 ・ Alexander Amini ・ 59 分鐘(在新分頁開啟原站)
- MIT 6.S191 (2025): Reinforcement Learning影片 ・ Alexander Amini ・ 1 小時 2 分(在新分頁開啟原站)
- 人工智慧:機器學習與理論基礎 05. Reinforcement learning影片 ・ NTU OpenCourseWare ・ 2 小時 16 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
