影片高階EN2 萬 次觀看
Stanford CS336 Language Modeling from Scratch | Spring 2026 | Guest Lecture: Dan Fu
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
Dan Fu 演講分享語言模型從訓練到推論的完整流程,重點在於如何將 GPU 轉化為實際的「智慧引擎」。內容涵蓋推論服務架構、最佳化 KV Cache 的策略,以及透過 Mega Kernels 技術減少 GPU 等待時間以提升效率。
A talk on the inference lifecycle of language models, covering optimization techniques like Mega Kernels and hardware co-design for production efficiency.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 推論是將電力轉化為智慧的關鍵引擎,需最佳化 GPU 核心技術。
- Mega Kernels 技術能融合多項操作,大幅減少 GPU 等待時間。
- 不同工作負載(如程式碼生成 vs 批處理)需要不同的架構設計。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- NVIDIA
- AMD
- DeepSeek MLA
- NCCL
- H100
- B200
適合誰看
正在學習或從事大語言模型推論系統開發、最佳化與架構設計的工程師與研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.61
- 新鮮
- 0.63
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 加快語言模型生成速度 (2/2):KV Cache影片 ・ Hung-yi Lee ・ 39 分鐘(在新分頁開啟原站)
- The Inference Engineering Masterclass — Philip Kiely & Ali Taha, BasetenPodcast ・ Latent Space ・ 1 小時 41 分
- Stanford CS329A Self-Improving AI Agents | Part 2 | Test-Time Compute Scaling影片 ・ Stanford Online ・ 1 小時 3 分
- NVIDIA GTC 2025 - Building LLM-Powered Applications文章 ・ Eugene Yan(部落格)
- 【生成式AI時代下的機器學習(2025)】助教課:利用多張GPU訓練大型語言模型—從零開始介紹DeepSpeed、Liger Kernel、Flash Attention及Quantization影片 ・ Hung-yi Lee ・ 55 分鐘
- NVIDIA's AI Engineers: Agent Inference at Planetary Scale and "Speed of Light" — Nader Khalil (Brev), Kyle Kranen (Dynamo)Podcast ・ Latent Space ・ 1 小時 24 分
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
