跳到主要內容
AI 武林
Podcast高階EN

Scaling Agentic Inference Across Heterogeneous Compute with Zain Asgar - #757

來源 The TWIML AI Podcast

聽節目(在新分頁開啟原站)連到 The TWIML AI Podcast

摘要

探討 Gimlet Labs 如何透過異質運算架構,將 AI 工作負載分散於不同硬體以提升效能與成本效益。講者介紹了將模型拆解、使用 LLM 自動最佳化運算核心等技術,並討論了從邊緣裝置到資料中心的應用挑戰。

A podcast interview discussing heterogeneous AI inference strategies and automated kernel optimization for agentic systems.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 將 AI 工作負載分散於不同硬體以最佳化成本與效能。
  • 使用 LLM 自動生成並驗證針對特定硬體的最優運算核心。
  • 針對代理系統設計異質運算架構以減少延遲與 API 呼叫。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00訓練硬體回歸超級電腦時代
  2. 07:17動態資源分配與 Kubernetes 協作
  3. 09:43異質硬體網路編排與記憶體直通
  4. 13:29Python 追蹤生成與圖譜編譯
  5. 17:08工作載體細粒度拆分與成本建模
  6. 19:44硬體迴路自動編譯與量化驗證
  7. 26:02AI 輔助系統規劃與未來演進
  8. 28:23H100 核心最佳化已達極限,提升空間極小
  9. 31:53混合異質硬體可節省兩成 GPU 資源浪費
  10. 38:21大客戶工作負載分散,需降低每 token 成本
  11. 40:48主體仍為 NVIDIA 架構,極端異質僅限主權雲
  12. 45:42推出開發者介面產品,聚焦大規模代理工作負載

提到的工具與公司

  • Kubernetes
  • DRA
  • H100
  • B200
  • PyTorch
  • NVIDIA

適合誰看

從事 AI 基礎設施、雲端架構或異質運算最佳化工作的工程師與開發者。

摘要依據

講者
Sam Charrington
依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.31

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)