跳到主要內容
AI 武林

科学空间(苏剑林)

部落格 ・ 華語圈 ・ 簡體中文 ・ A 級 ・ 4 筆內容 ・ 最近更新 2026/08/31

簡中;優化器、注意力、擴散模型背後的數學推導,中文圈最硬的 ML 理論長文,每週一篇

最受歡迎

依人氣

  1. 2文章高階中文

    让炼丹更科学一些(八):多阶段训练的学习率

    從多階段訓練角度重新思考無排程學習率,提出「等效步數」概念以修正理論結論。讀者可學習如何將 SGD 理論應用於 Adam 等實際最佳化器,並掌握多階段訓練中平衡各階段效果的設定方法。

  2. 3文章高階中文

    简单谈谈K3的MoE和Attention

    深入解析 K3 模型在混合專家(MoE)與注意力機制(Attention)上的架構設計,重點探討 Stable LatentMoE 的穩定性最佳化與 MLA 的取捨。

  3. 4文章高階中文

    动量的新理解:逼近特征层面的梯度下降

    動量最佳化器重新詮釋為一個線上回歸問題的解,旨在讓參數更新逼近特徵層面的梯度下降。透過引入自相關矩陣作為預條件器,文章探討了 Newton-Muon 等變體的理論基礎與工程挑戰。

最新內容

依發布時間

  1. 文章高階中文

    让炼丹更科学一些(八):多阶段训练的学习率

    從多階段訓練角度重新思考無排程學習率,提出「等效步數」概念以修正理論結論。讀者可學習如何將 SGD 理論應用於 Adam 等實際最佳化器,並掌握多階段訓練中平衡各階段效果的設定方法。

  2. 文章高階中文

    动量的新理解:逼近特征层面的梯度下降

    動量最佳化器重新詮釋為一個線上回歸問題的解,旨在讓參數更新逼近特徵層面的梯度下降。透過引入自相關矩陣作為預條件器,文章探討了 Newton-Muon 等變體的理論基礎與工程挑戰。

  3. 文章高階中文

    简单谈谈K3的MoE和Attention

    深入解析 K3 模型在混合專家(MoE)與注意力機制(Attention)上的架構設計,重點探討 Stable LatentMoE 的穩定性最佳化與 MLA 的取捨。