跳到主要內容
AI 武林
Podcast高階EN

NVIDIA's AI Engineers: Agent Inference at Planetary Scale and "Speed of Light" — Nader Khalil (Brev), Kyle Kranen (Dynamo)

來源 Latent Space

聽節目(在新分頁開啟原站)連到 Latent Space

摘要

訪談 NVIDIA 工程師 Nader Khalil 與 Kyle Kranen,探討 Brev 如何降低開發者使用高階 GPU 的門檻,以及 Dynamo 框架如何透過預填充與解碼分離技術,實現大規模推理加速與成本最佳化。

Interview discussing NVIDIA's Brev developer tool for GPU access and Dynamo framework for scalable, optimized AI inference at datacenter scale.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • Brev 透過簡化介面讓開發者快速存取與配置高階 GPU 硬體。
  • Dynamo 利用 Kubernetes 與動態排程,將預填充與解碼階段分離以最佳化資源。
  • 討論長上下文限制、模型與硬體協同設計及 Agent 安全基礎。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00AI 代理許可權邊界與安全防護
  2. 06:47NVIDIA 併購故事與內部安全策略
  3. 11:17Grace Blackwell 硬體開發經驗
  4. 13:36Jensen 創業故事與零百億美元市場
  5. 24:02推理規模化與測試時擴展
  6. 26:21Kimmy 模型架構與專家設計
  7. 43:48模型上下文限制與硬體協同
  8. 47:14Bash 作為通用工具訓練模型的優缺點
  9. 52:58NVIDIA GTC 活動與 Dynamo 技術分享
  10. 1:04:06零碼碼駭客松與 Agent 挑戰賽概念
  11. 1:06:34Dynamo 終端 CLI 功能與開源計劃
  12. 1:09:45編碼 Agent 突破限制進入真實世界
  13. 1:20:03早期 AI 創業社群與自動化駕駛發展
  14. 1:22:11真實自我表達對寫作與溝通的幫助

提到的工具與公司

  • NVIDIA Dynamo
  • SGLang
  • TRT-LLM
  • vLLM
  • Kubernetes
  • Brev
  • Ruben CPX
  • Grove

適合誰看

從事大語言模型部署、雲端基礎設施或 AI 系統架構的開發者與工程師。

摘要依據

講者
Nader Khalil、Alessio Fanelli
依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.45

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)