讀原文(在新分頁開啟原站)連到 科学空间(苏剑林)
摘要
探討大型語言模型預訓練中除交叉熵外的損失函式選擇,透過數學推導說明為何交叉熵與 Softmax 是最佳搭配。讀者可理解不同損失函式的梯度特性與適用場景,並掌握替代激活函數的理論基礎。
This article mathematically derives alternative loss functions for LLM training beyond cross-entropy and explains why cross-entropy with Softmax is optimal.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 交叉熵因梯度乾淨且與 Softmax 完美搭配成為標準選擇。
- 自然語言建模需處理多對一分佈,要求損失函式具備線性性質。
- 推匯出對數評分、Brier 評分等替代方案及其優缺點。
適合誰看
正在學習機器學習原理或開發大型語言模型的工程師與研究者。
摘要依據
- 講者
- Jianlin Su
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.79
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- But what is cross-entropy? | Compression is Intelligence Part 2影片 ・ 3Blue1Brown ・ 34 分鐘
- DPO 算法原理与代码实现:让 LLM 对齐变得简单文章 ・ chaofa用代码打点酱油(袁朝发)
- Reiner Pope – The math behind how LLMs are trained and servedPodcast ・ Dwarkesh Podcast ・ 2 小時 14 分
- SITCON 2025 R2|開發者的暗黑小紅帽:大野狼與 LLM|講者 slasho影片 ・ SITCON 學生計算機年會 ・ 41 分鐘
- Stanford CS229 Machine Learning | Spring 2026 | Lecture 13: LLMs, Next-Word Prediction Loss影片 ・ Stanford Online ・ 1 小時 1 分
- 【生成式AI導論 2024】第7講:大型語言模型修練史 — 第二階段: 名師指點,發揮潛力 (兼談對 ChatGPT 做逆向工程與 LLaMA 時代的開始)影片 ・ Hung-yi Lee ・ 38 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)