影片入門中文8.8 萬 次觀看
【生成式AI導論 2024】第8講:大型語言模型修練史 — 第三階段: 參與實戰,打磨技巧 (Reinforcement Learning from Human Feedback, RLHF)
看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
詳細介紹大型語言模型訓練的第三階段 RLHF,透過人類回饋調整模型行為。內容涵蓋 RLHF 與指令微調的差異、PPO 演算法原理、回饋模型訓練方式,以及安全與有用性的權衡問題。
This course explains the third stage of LLM training, RLHF, covering its mechanism, reward models, and future challenges in human feedback alignment.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- RLHF 透過人類比較答案來微調模型,而非直接提供正確答案。
- 回饋模型模擬人類偏好,用於評分並引導模型最佳化表現。
- 未來挑戰在於人類自身也無法判斷的複雜議題該如何回饋。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- PPO
- GPT-4
- Gemini
- Claude
適合誰看
正在學習機器學習原理或開發大型語言模型的開發者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.52
- 新鮮
- 0.03
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!影片 ・ StatQuest with Josh Starmer ・ 18 分鐘(在新分頁開啟原站)
- Reinforcement Learning from Human Feedback explained with math derivations and the PyTorch code.影片 ・ Umar Jamil ・ 2 小時 15 分(在新分頁開啟原站)
- Reinforcement Learning with Human Feedback (RLHF) in 4 minutes影片 ・ Sebastian Raschka ・ 4 分鐘(在新分頁開啟原站)
- 【生成式AI導論 2024】第7講:大型語言模型修練史 — 第二階段: 名師指點,發揮潛力 (兼談對 ChatGPT 做逆向工程與 LLaMA 時代的開始)影片 ・ Hung-yi Lee ・ 38 分鐘
- 【生成式AI導論 2024】第6講:大型語言模型修練史 — 第一階段: 自我學習,累積實力 (熟悉機器學習的同學從 15:00 開始看起即可)影片 ・ Hung-yi Lee ・ 34 分鐘
- 5 useful things you'll learn in my new post-training textbook (shipping now!)文章 ・ Nathan Lambert(部落格)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
