影片進階中文6.6 萬 次觀看
【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?
看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
李宏毅教授介紹大型語言模型如何透過深度思考(Reasoning)提升推理能力,涵蓋思維鏈、模仿學習與強化學習等方法。課程以 DeepSeek-R1 為例,說明模型如何模擬人類思考過程並進行自我驗證,同時探討測試時運算(Test Time Compute)對結果的影響。
This course explains how large language models perform deep reasoning using techniques like imitation learning and reinforcement learning, illustrated with DeepSeek-R1.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 深度思考模型會先輸出冗長的推理過程再給答案。
- 透過模仿學習與強化學習可訓練模型具備推理能力。
- 測試時增加運算投入能提升模型推理的準確度。
章節
依話題轉折切分,標題由 AI 產生
- 00:00深度思考型大模型的代表與行為特徵
- 04:50測試時間計算在棋類遊戲中的歷史應用
- 10:46Chain-of-Thought 的演進與實現方式
- 13:31透過監督學習引導模型進行步驟思考
- 18:49無限猴子理論與大量嘗試尋找正確解
- 22:16利用答案置信度與多數投票法選出正解
- 25:15訓練驗證器以確認解題過程的正確性
- 38:20Bin Search 與 DVTS 的變形方法
- 41:00讓模型自行產出推論過程
- 54:46以結果為導向的 Reinforcement Learning
- 1:01:07D-SIG R1 的複雜打造過程
- 1:09:10RL 訓練中忽略過程品質的問題
- 1:13:53深度思考模型的冗長推論細節
提到的工具與公司
- DeepSeek-R1
- DVTS
適合誰看
對機器學習、大型語言模型或 AI 推理技術有興趣的開發者與研究者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.54
- 新鮮
- 0.13
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- The State Of LLMs 2025: Progress, Problems, and Predictions文章 ・ Sebastian Raschka(部落格)
- EP 67. 解析DeepSeek R1技术创新与生态影响:强化学习,Long CoT,数据,Agent与开源生态Podcast ・ OnBoard! ・ 2 小時 49 分
- EP 62. Google Deepmind 与LLM研究员深度解读OpenAI o1 及LLM+强化学习新范式Podcast ・ OnBoard! ・ 2 小時 43 分
- Why We Think文章 ・ Lilian Weng(部落格)
- 【生成式人工智慧與機器學習導論2025】第 7 講:大型語言模型的學習歷程影片 ・ Hung-yi Lee ・ 1 小時 59 分(在新分頁開啟原站)
- 【生成式AI時代下的機器學習(2025)】第八講:大型語言模型的推理過程不用太長、夠用就好影片 ・ Hung-yi Lee ・ 24 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
