看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
詳細介紹大型語言模型的三個訓練階段:預訓練、監督式微調與人類回饋強化學習。透過文字接龍的分類問題解釋原理,並分析 Pre-training 資料如何影響模型行為,最後說明 RLHF 可被 AI 取代。
This video explains the three-stage training process of large language models, covering pre-training, SFT, and RLHF.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 大型語言模型訓練分為預訓練、微調與人類回饋三階段。
- 三個階段本質都是文字接龍分類問題,僅資料來源不同。
- RLHF 階段的人類回饋可被 AI 獎勵模型取代。
章節
依話題轉折切分,標題由 AI 產生
- 00:00大型語言模型三階段學習流程
- 03:12訓練本質不變僅改變教材品質
- 15:2215T Token 體積與記憶壓縮原理
- 28:04微波爐噪音資料破壞訓練穩定性
- 32:33利用重述技術提升網路資料品質
- 50:07SFT 階段僅調整輸出風格非新知
- 55:10對齊階段未改變模型機率分佈
- 59:07Pre-training 遺跡與 ROT 解碼實驗
- 1:03:18打造專才模型與打造通材模型兩條路線
- 1:07:55InstructGPT 證實少量 SFT 資料即可激發能力
- 1:28:18RLHF 透過人類反饋讓模型學習人類偏好
- 1:37:05SFT 與 RL 在學習機制上的關鍵差異
- 1:45:13Policy Gradient 系列演算法與圍棋演算法類比
- 1:52:08將 RLHF 中的人類回饋替換為 AI 回饋
適合誰看
對機器學習原理或大型語言模型運作機制感興趣的學習者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.54
- 新鮮
- 0.29
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 【生成式AI導論 2024】第8講:大型語言模型修練史 — 第三階段: 參與實戰,打磨技巧 (Reinforcement Learning from Human Feedback, RLHF)影片 ・ Hung-yi Lee ・ 37 分鐘
- 【生成式AI導論 2024】第6講:大型語言模型修練史 — 第一階段: 自我學習,累積實力 (熟悉機器學習的同學從 15:00 開始看起即可)影片 ・ Hung-yi Lee ・ 34 分鐘
- Developing an LLM: Building, Training, Finetuning影片 ・ Sebastian Raschka ・ 59 分鐘(在新分頁開啟原站)
- Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!影片 ・ StatQuest with Josh Starmer ・ 18 分鐘(在新分頁開啟原站)
- How are large language models trained?影片 ・ Google for Developers ・ 10 分鐘(在新分頁開啟原站)
- Build an LLM from Scratch 7: Instruction Finetuning影片 ・ Sebastian Raschka ・ 1 小時 46 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
