除了交叉熵,LM Loss还有什么选择?
探討大型語言模型預訓練中除交叉熵外的損失函式選擇,透過數學推導說明為何交叉熵與 Softmax 是最佳搭配。讀者可理解不同損失函式的梯度特性與適用場景,並掌握替代激活函數的理論基礎。
Jianlin Su ・ 4 筆內容
依人氣
探討大型語言模型預訓練中除交叉熵外的損失函式選擇,透過數學推導說明為何交叉熵與 Softmax 是最佳搭配。讀者可理解不同損失函式的梯度特性與適用場景,並掌握替代激活函數的理論基礎。
從多階段訓練角度重新思考無排程學習率,提出「等效步數」概念以修正理論結論。讀者可學習如何將 SGD 理論應用於 Adam 等實際最佳化器,並掌握多階段訓練中平衡各階段效果的設定方法。
深入解析 K3 模型在混合專家(MoE)與注意力機制(Attention)上的架構設計,重點探討 Stable LatentMoE 的穩定性最佳化與 MLA 的取捨。
動量最佳化器重新詮釋為一個線上回歸問題的解,旨在讓參數更新逼近特徵層面的梯度下降。透過引入自相關矩陣作為預條件器,文章探討了 Newton-Muon 等變體的理論基礎與工程挑戰。
依發布時間
從多階段訓練角度重新思考無排程學習率,提出「等效步數」概念以修正理論結論。讀者可學習如何將 SGD 理論應用於 Adam 等實際最佳化器,並掌握多階段訓練中平衡各階段效果的設定方法。
動量最佳化器重新詮釋為一個線上回歸問題的解,旨在讓參數更新逼近特徵層面的梯度下降。透過引入自相關矩陣作為預條件器,文章探討了 Newton-Muon 等變體的理論基礎與工程挑戰。
探討大型語言模型預訓練中除交叉熵外的損失函式選擇,透過數學推導說明為何交叉熵與 Softmax 是最佳搭配。讀者可理解不同損失函式的梯度特性與適用場景,並掌握替代激活函數的理論基礎。
深入解析 K3 模型在混合專家(MoE)與注意力機制(Attention)上的架構設計,重點探討 Stable LatentMoE 的穩定性最佳化與 MLA 的取捨。