跳到主要內容
AI 武林
文章高階中文

除了交叉熵,LM Loss还有什么选择?

來源 科学空间(苏剑林)人物 蘇劍林 Jianlin Su

讀原文(在新分頁開啟原站)連到 科学空间(苏剑林)

摘要

探討大型語言模型預訓練中除交叉熵外的損失函式選擇,透過數學推導說明為何交叉熵與 Softmax 是最佳搭配。讀者可理解不同損失函式的梯度特性與適用場景,並掌握替代激活函數的理論基礎。

This article mathematically derives alternative loss functions for LLM training beyond cross-entropy and explains why cross-entropy with Softmax is optimal.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 交叉熵因梯度乾淨且與 Softmax 完美搭配成為標準選擇。
  • 自然語言建模需處理多對一分佈,要求損失函式具備線性性質。
  • 推匯出對數評分、Brier 評分等替代方案及其優缺點。

適合誰看

正在學習機器學習原理或開發大型語言模型的工程師與研究者。

摘要依據

講者
Jianlin Su
依據
文章全文

為什麼排在這裡

人氣
0.75
新鮮
0.79

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)