跳到主要內容
AI 武林
影片入門中文4 萬 次觀看

【生成式人工智慧與機器學習導論2025】第 7 講:大型語言模型的學習歷程

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

詳細介紹大型語言模型的三個訓練階段:預訓練、監督式微調與人類回饋強化學習。透過文字接龍的分類問題解釋原理,並分析 Pre-training 資料如何影響模型行為,最後說明 RLHF 可被 AI 取代。

This video explains the three-stage training process of large language models, covering pre-training, SFT, and RLHF.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 大型語言模型訓練分為預訓練、微調與人類回饋三階段。
  • 三個階段本質都是文字接龍分類問題,僅資料來源不同。
  • RLHF 階段的人類回饋可被 AI 獎勵模型取代。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00大型語言模型三階段學習流程
  2. 03:12訓練本質不變僅改變教材品質
  3. 15:2215T Token 體積與記憶壓縮原理
  4. 28:04微波爐噪音資料破壞訓練穩定性
  5. 32:33利用重述技術提升網路資料品質
  6. 50:07SFT 階段僅調整輸出風格非新知
  7. 55:10對齊階段未改變模型機率分佈
  8. 59:07Pre-training 遺跡與 ROT 解碼實驗
  9. 1:03:18打造專才模型與打造通材模型兩條路線
  10. 1:07:55InstructGPT 證實少量 SFT 資料即可激發能力
  11. 1:28:18RLHF 透過人類反饋讓模型學習人類偏好
  12. 1:37:05SFT 與 RL 在學習機制上的關鍵差異
  13. 1:45:13Policy Gradient 系列演算法與圍棋演算法類比
  14. 1:52:08將 RLHF 中的人類回饋替換為 AI 回饋

適合誰看

對機器學習原理或大型語言模型運作機制感興趣的學習者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.54
新鮮
0.29

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)