影片進階EN4,781 次觀看
Stanford CS229 Machine Learning | Spring 2026 | Lecture 18: GMM (EM), PCA
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
介紹強化學習基礎,解釋序列決策、獎勵機制與探索利用的平衡。透過馬可夫決策過程模型,詳細說明策略梯度演算法的數學原理與計算方法,讓讀者理解如何用試錯法訓練機器人或大語言模型。
This lecture introduces the fundamentals of reinforcement learning, covering sequential decision-making, reward mechanisms, and the policy gradient algorithm within the Markov decision process framework.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 強化學習透過獎勵訊號在無監督環境中學習序列決策。
- 策略梯度演算法利用試錯法最佳化行動策略以最大化長期回報。
- 馬可夫決策過程是描述環境與行動互動的核心數學框架。
章節
依話題轉折切分,標題由 AI 產生
適合誰看
正在學習機器學習理論、機器人控制或大語言模型訓練的學生與工程師。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.54
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CS229 Machine Learning | Spring 2026 | Lecture 20: GMM (EM), PCA影片 ・ Stanford Online ・ 1 小時 19 分
- Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 19: Model-Based RL影片 ・ Stanford Online ・ 1 小時 22 分(在新分頁開啟原站)
- 人工智慧:機器學習與理論基礎 05. Reinforcement learning影片 ・ NTU OpenCourseWare ・ 2 小時 16 分(在新分頁開啟原站)
- MIT 6.S191 (2024): Reinforcement Learning影片 ・ Alexander Amini ・ 1 小時(在新分頁開啟原站)
- Training Agents 3: Reinforcement Learning影片 ・ Hugging Face ・ 1 小時 17 分(在新分頁開啟原站)
- Policy Gradient Algorithms文章 ・ Lilian Weng(部落格)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
