跳到主要內容
AI 武林
影片進階中文6.6 萬 次觀看

【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

李宏毅教授介紹大型語言模型如何透過深度思考(Reasoning)提升推理能力,涵蓋思維鏈、模仿學習與強化學習等方法。課程以 DeepSeek-R1 為例,說明模型如何模擬人類思考過程並進行自我驗證,同時探討測試時運算(Test Time Compute)對結果的影響。

This course explains how large language models perform deep reasoning using techniques like imitation learning and reinforcement learning, illustrated with DeepSeek-R1.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 深度思考模型會先輸出冗長的推理過程再給答案。
  • 透過模仿學習與強化學習可訓練模型具備推理能力。
  • 測試時增加運算投入能提升模型推理的準確度。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00深度思考型大模型的代表與行為特徵
  2. 04:50測試時間計算在棋類遊戲中的歷史應用
  3. 10:46Chain-of-Thought 的演進與實現方式
  4. 13:31透過監督學習引導模型進行步驟思考
  5. 18:49無限猴子理論與大量嘗試尋找正確解
  6. 22:16利用答案置信度與多數投票法選出正解
  7. 25:15訓練驗證器以確認解題過程的正確性
  8. 38:20Bin Search 與 DVTS 的變形方法
  9. 41:00讓模型自行產出推論過程
  10. 54:46以結果為導向的 Reinforcement Learning
  11. 1:01:07D-SIG R1 的複雜打造過程
  12. 1:09:10RL 訓練中忽略過程品質的問題
  13. 1:13:53深度思考模型的冗長推論細節

提到的工具與公司

  • DeepSeek-R1
  • DVTS

適合誰看

對機器學習、大型語言模型或 AI 推理技術有興趣的開發者與研究者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.54
新鮮
0.13

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)