讀原文(在新分頁開啟原站)連到 科学空间(苏剑林)
摘要
深入分析經典論文 AdaGrad 的數學推導,解釋為何需要將學習率從標量推廣為預條件矩陣,並復現其收斂性證明。讀者能理解後續主流最佳化器如 Adam、RMSProp 的理論淵源與設計原理。
This article reviews the mathematical derivation of the classic AdaGrad paper, explaining the need for preconditioner matrices and the theoretical foundations of modern optimizers like Adam and RMSProp.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 復現 AdaGrad 經典論文的核心數學推導過程。
- 解釋為何需要引入預條件矩陣來處理梯度更新。
- 釐清 Adam、RMSProp 等最佳化器的理論基礎與差異。
提到的工具與公司
- AdaGrad
- Adam
- RMSProp
- SGD
- PSGD
- Shampoo
- KL-Shampoo
- AdaBK
適合誰看
正在學習機器學習理論或需要深入理解最佳化器原理的開發者。
摘要依據
- 講者
- Jianlin Su
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.88
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 让炼丹更科学一些(十):单调性假设的拆与补文章 ・ 科学空间(苏剑林)
- 慢即是快:1. Shampoo的尽头是Muon?文章 ・ 科学空间(苏剑林)
- Stanford CS229 Machine Learning | Spring 2026 | Lecture 8: Neural Networks 2 (Backprop)影片 ・ Stanford Online ・ 1 小時 2 分
- Stanford CS229 Machine Learning | Spring 2026 | Lecture 3: Weighted Least Squares影片 ・ Stanford Online ・ 1 小時 2 分
- Some Math behind Neural Tangent Kernel文章 ・ Lilian Weng(部落格)
- Policy Gradient Algorithms文章 ・ Lilian Weng(部落格)
這個來源最近的內容
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)