Podcast高階EN
Scaling Agentic Inference Across Heterogeneous Compute with Zain Asgar - #757
聽節目(在新分頁開啟原站)連到 The TWIML AI Podcast
摘要
探討 Gimlet Labs 如何透過異質運算架構,將 AI 工作負載分散於不同硬體以提升效能與成本效益。講者介紹了將模型拆解、使用 LLM 自動最佳化運算核心等技術,並討論了從邊緣裝置到資料中心的應用挑戰。
A podcast interview discussing heterogeneous AI inference strategies and automated kernel optimization for agentic systems.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 將 AI 工作負載分散於不同硬體以最佳化成本與效能。
- 使用 LLM 自動生成並驗證針對特定硬體的最優運算核心。
- 針對代理系統設計異質運算架構以減少延遲與 API 呼叫。
章節
依話題轉折切分,標題由 AI 產生
- 00:00訓練硬體回歸超級電腦時代
- 07:17動態資源分配與 Kubernetes 協作
- 09:43異質硬體網路編排與記憶體直通
- 13:29Python 追蹤生成與圖譜編譯
- 17:08工作載體細粒度拆分與成本建模
- 19:44硬體迴路自動編譯與量化驗證
- 26:02AI 輔助系統規劃與未來演進
- 28:23H100 核心最佳化已達極限,提升空間極小
- 31:53混合異質硬體可節省兩成 GPU 資源浪費
- 38:21大客戶工作負載分散,需降低每 token 成本
- 40:48主體仍為 NVIDIA 架構,極端異質僅限主權雲
- 45:42推出開發者介面產品,聚焦大規模代理工作負載
提到的工具與公司
- Kubernetes
- DRA
- H100
- B200
- PyTorch
- NVIDIA
適合誰看
從事 AI 基礎設施、雲端架構或異質運算最佳化工作的工程師與開發者。
摘要依據
- 講者
- Sam Charrington
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.31
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Neil Movva - Making AI 10x Cheaper - [Invest Like the Best, EP.488]Podcast ・ Invest Like the Best ・ 1 小時 18 分
- Local AI 201: Inference Engines, Hardware Stack影片 ・ Hugging Face ・ 53 分鐘(在新分頁開啟原站)
- 81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向Podcast ・ 卫诗婕|漫谈 Light the Star ・ 1 小時 3 分
- Kubernetes, Compliance, and Control: The Operational Backbone of AI SovereigntyPodcast ・ AI Engineering Podcast ・ 1 小時 1 分
- The Five-Layer Cake Approach to Scaling AI Without Wasting MoneyPodcast ・ Agentic Conversations(原 MLOps.community) ・ 39 分鐘
- The End of GPU Scaling? Compute & The Agent Era — Tim Dettmers (Ai2) & Dan Fu (Together AI)Podcast ・ The MAD Podcast ・ 1 小時 4 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
