聽節目(在新分頁開啟原站)連到 The TWIML AI Podcast
摘要
探討 AI 推理工程如何成為最關鍵的工作量。講者 Philip Kiely 解釋了從 API 到專用部署的成熟路徑,並強調理解批處理、量化、Speculative 程式設計等「閥門」對於設計產品 SLA 的重要性。內容涵蓋了推理與模型服務的分界、GPU 週期、主流推理執行時(如 vLLM、SGLang)以及未來向邊緣與多模態進化的趨勢。
Philip Kiely discusses how inference engineering has become the most critical workload in AI, blending GPU programming, research, and distributed systems. He outlines the path from closed APIs to in-house platforms, highlights key knobs like batching and quantization, and explores future trends in H…
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 推理工程是 AI 最複雜且關鍵的工作量,需整合 GPU 程式、研究與大規模系統。
- 從 API 到專用部署的推理成熟路徑,需平衡成本、容量與效能。
- 主流推理執行時如 vLLM、SGLang 與 TensorRT LLM 因開發複雜性而流行。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Philip Kiely 分享 AI 推理系統工程化方法
- 04:49從影響公司到推理工程:Philip Kiely 的職業起點
- 09:57研究轉化為生產:AI 推理時間線的極速變化
- 12:54哪些人應該關注推理工程?
- 15:39為何好的推理能決定產品體驗?
- 21:20工程師如何掌握推理控制的許可權?
- 26:53從 API 開起到 GPU 週期:Philip Kiely 的經驗
- 31:45AI 輔助程式碼如何影響推理系統自動化
- 36:28為什麼推理工程難以完全由 AI 取代
- 42:34多模態模型如何改變推理系統的需求
- 44:54不同模態的推理系統需要什麼特殊最佳化
- 47:38為什麼某些模態能重用現有系統
- 50:32市場集中於開源解決方案的原因
- 53:222026 年硬體專化如何提升推理效能
提到的工具與公司
- vLLM
- SGLang
- TensorRT LLM
- Ampere
- Hopper
- Blackwell
- CUDA
適合誰看
AI 工程師、模型開發者、系統架構師及對推理效能有需求的企業技術人員。
摘要依據
- 講者
- Sam Charrington
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.55
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- The Inference Engineering Masterclass — Philip Kiely & Ali Taha, BasetenPodcast ・ Latent Space ・ 1 小時 41 分
- Local AI 201: Inference Engines, Hardware Stack影片 ・ Hugging Face ・ 53 分鐘(在新分頁開啟原站)
- GTC 2026:AI的下一个战场不是模型,而是「推理系统」| S10E04Podcast ・ What's Next|科技早知道 ・ 59 分鐘(在新分頁開啟原站)
- The CEO Behind the Fastest-Growing AI Inference Company | Tuhin SrivastavaPodcast ・ Gradient Dissent ・ 59 分鐘(在新分頁開啟原站)
- NVIDIA's AI Engineers: Agent Inference at Planetary Scale and "Speed of Light" — Nader Khalil (Brev), Kyle Kranen (Dynamo)Podcast ・ Latent Space ・ 1 小時 24 分(在新分頁開啟原站)
- What's New in Inference Engineering — Philip Kiely, Baseten影片 ・ AI Engineer ・ 19 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
