讀原文(在新分頁開啟原站)連到 科学空间(苏剑林)
摘要
從多階段訓練角度重新思考無排程學習率,提出「等效步數」概念以修正理論結論。讀者可學習如何將 SGD 理論應用於 Adam 等實際最佳化器,並掌握多階段訓練中平衡各階段效果的設定方法。
This article revisits schedule-free learning rates from a multi-stage training perspective, introducing the concept of effective steps to bridge theory and practice.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 提出等效步數概念修正無排程學習率理論。
- 區分意外與計劃情境,提供多階段訓練策略。
- 說明如何將理論結論應用於實際最佳化器與 Scaling Law。
適合誰看
正在進行機器學習模型訓練或研究最佳化理論的開發者與研究者。
摘要依據
- 講者
- Jianlin Su
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.86
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Curriculum for Reinforcement Learning文章 ・ Lilian Weng(部落格)
- MIT 6.S191: Secrets of Massively Parallel Training影片 ・ Alexander Amini ・ 53 分鐘
- Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL影片 ・ Stanford Online ・ 1 小時 13 分
- 【生成式人工智慧與機器學習導論2025】第 7 講:大型語言模型的學習歷程影片 ・ Hung-yi Lee ・ 1 小時 59 分
- 动量的新理解:逼近特征层面的梯度下降文章 ・ 科学空间(苏剑林)
- 【生成式人工智慧與機器學習導論2025】第 6 講:一堂課搞懂訓練類神經網路的各種訣竅影片 ・ Hung-yi Lee ・ 2 小時 6 分
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)