跳到主要內容
AI 武林
影片進階中文2.7 萬 次觀看

【生成式AI時代下的機器學習(2025)】第八講:大型語言模型的推理過程不用太長、夠用就好

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

探討大型語言模型推理過程過長是否必要,指出推理長度與正確率未必正相關,反而消耗額外算力。透過控制提示詞、調整參數、知識蒸餾及強化學習獎勵機制,可訓練出推理短且準確的模型,達到資源效率與效能的平衡。

This lecture explains how to optimize large language models to reason efficiently without unnecessary long outputs, balancing accuracy and computational cost.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 推理長度過長未必提升正確率,反而浪費算力資源。
  • 透過提示詞最佳化與參數調整可控制模型推理長度。
  • 利用知識蒸餾與強化學習獎勵機制訓練短推理模型。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:01推理長度與正確率呈負相關
  2. 05:12Chain of Draft 避免冗長思考
  3. 09:05漸進式移除推理過程訓練
  4. 11:54RL 獎勵機制控制輸出長度
  5. 16:44過長推理反而損害推理能力
  6. 21:29過猶不及:推理長度適中最佳

提到的工具與公司

  • Claude 3.5
  • Sonnet
  • DeepSeek R1
  • Gemini
  • AIME
  • GSM8K

適合誰看

正在學習機器學習原理、開發或除錯大型語言模型的工程師與研究者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.46
新鮮
0.14

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)