跳到主要內容
AI 武林
文章高階EN

vLLM Support for NVIDIA Vera Rubin NVL72: 7.8x Throughput over GB200 NVL72

來源 vLLM Blog

讀原文(在新分頁開啟原站)連到 vLLM Blog

摘要

vLLM 團隊宣佈支援 NVIDIA Vera Rubin NVL72 硬體,透過 Rubin 調優的 FlashInfer 核與 locality-aware MoE 技術,在 AgentX 測試中實現比 GB200 高 7.8 倍的單卡吞吐量。文章詳述了如何利用 CUDA 13.4 的 locality domain 最佳化 MoE 解碼,並提供每日容器建置與模型支援清單。

vLLM announces support for NVIDIA Vera Rubin NVL72, achieving 7.8x throughput gains via tuned kernels and locality-aware MoE optimizations.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • vLLM 正式支援 NVIDIA Vera Rubin NVL72 硬體,提供 7.8 倍吞吐量提升。
  • 利用 locality domain 與 Rubin 調優核,最佳化 MoE 解碼與注意力機制。
  • 提供每日容器建置與 DeepSeek、MiniMax 等模型的即時部署方案。

提到的工具與公司

適合誰看

正在使用或規劃部署大規模 LLM 推理服務、需要極致效能的開發者與系統工程師。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
1.00

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

這個來源最近的內容

vLLM Blog 的所有內容

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)