看影片(在新分頁開啟原站)連到 YouTube・Julia Turc
摘要
解析為何傳統大型語言模型推理受記憶體牆限制,並探討 HBM、屋頂線模型及 vLLM 等最佳化技術。觀眾可了解記憶體與運算密集型任務的差異,以及擴散式模型如何改變工作負載。
This video explains why traditional LLMs are memory-bound and how new architectures like diffusion models shift the workload to compute-bound tasks.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- NVIDIA H100
- vLLM
- SGLang
- TensorRT-LLM
- FOCUS
適合誰看
適合具備機器學習基礎、關注大模型推理效能與架構的開發者與研究者。
摘要依據
- 講者
- Julia Turc
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.43
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- How AI Models Scale Beyond a Single GPU Across LLM Workloads影片 ・ IBM Technology ・ 9 分鐘
- The Most Absurd Way To Train LLMs... With 3x Less Memory!?影片 ・ bycloud ・ 16 分鐘
- Fast inference changes what you can build影片 ・ DeepLearningAI ・ 2 分鐘
- Serve Your Own LLM: vLLM & SGLang, End-to-End影片 ・ Vizuara ・ 6 分鐘
- Optimizing vLLM on Arm CPUs文章 ・ vLLM Blog
- GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM文章 ・ vLLM Blog
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
