跳到主要內容
AI 武林
影片高階EN2 萬 次觀看

Stanford CS336 Language Modeling from Scratch | Spring 2026 | Guest Lecture: Dan Fu

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

Dan Fu 演講分享語言模型從訓練到推論的完整流程,重點在於如何將 GPU 轉化為實際的「智慧引擎」。內容涵蓋推論服務架構、最佳化 KV Cache 的策略,以及透過 Mega Kernels 技術減少 GPU 等待時間以提升效率。

A talk on the inference lifecycle of language models, covering optimization techniques like Mega Kernels and hardware co-design for production efficiency.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 推論是將電力轉化為智慧的關鍵引擎,需最佳化 GPU 核心技術。
  • Mega Kernels 技術能融合多項操作,大幅減少 GPU 等待時間。
  • 不同工作負載(如程式碼生成 vs 批處理)需要不同的架構設計。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05從訓練轉向推理與服務架構
  2. 03:47GPU 成為新石油與系統最佳化
  3. 13:34Prefill 與 Decode 階段的核心挑戰
  4. 22:02大規模系統中極罕見但致命的 Bug
  5. 25:56KV Cache 儲存與 CPU 離線策略
  6. 29:39Blackwell 架構下的故障容忍與延遲
  7. 42:17Loop Transformers 與每參數效率新方向
  8. 46:58殘差塊動態系統分析與簡化
  9. 49:34閉式解法與譜半徑穩定性
  10. 54:37資料與參數並行縮放法則
  11. 59:41全棧創新與推理架構最佳化
  12. 1:03:20巨核編譯器開發成本與挑戰
  13. 1:07:14不同應用場景架構設計差異
  14. 1:09:48多機通訊融合與部分巨核策略

提到的工具與公司

  • NVIDIA
  • AMD
  • DeepSeek MLA
  • NCCL
  • H100
  • B200

適合誰看

正在學習或從事大語言模型推論系統開發、最佳化與架構設計的工程師與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.61
新鮮
0.63

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)