讀原文(在新分頁開啟原站)連到 vLLM Blog
摘要
vLLM 團隊宣佈支援 NVIDIA Vera Rubin NVL72 硬體,透過 Rubin 調優的 FlashInfer 核與 locality-aware MoE 技術,在 AgentX 測試中實現比 GB200 高 7.8 倍的單卡吞吐量。文章詳述了如何利用 CUDA 13.4 的 locality domain 最佳化 MoE 解碼,並提供每日容器建置與模型支援清單。
vLLM announces support for NVIDIA Vera Rubin NVL72, achieving 7.8x throughput gains via tuned kernels and locality-aware MoE optimizations.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- vLLM 正式支援 NVIDIA Vera Rubin NVL72 硬體,提供 7.8 倍吞吐量提升。
- 利用 locality domain 與 Rubin 調優核,最佳化 MoE 解碼與注意力機制。
- 提供每日容器建置與 DeepSeek、MiniMax 等模型的即時部署方案。
提到的工具與公司
適合誰看
正在使用或規劃部署大規模 LLM 推理服務、需要極致效能的開發者與系統工程師。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 1.00
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- PD Serving of Qwen3.8-2.4T文章 ・ vLLM Blog ・
- DeepSeek-V4.1-Flash on vLLM: 5x Agentic Throughput Since Day 0文章 ・ vLLM Blog ・
- Advancing Infrastructure for the Era of Agentic AI | Ian Buck at AI Infra Summit 2026影片 ・ NVIDIA ・ 29 分鐘 ・
- Scaling in the Agentic Era with NVIDIA Vera Rubin NVL72影片 ・ CoreWeave ・
- Built Together: Inside the Dell + CoreWeave Engineering Partnership Powering Next-Gen AI影片 ・ CoreWeave ・
- [Pro 6000 Training] 06 8卡 RTX PRO 6000 原生 FP4 装下 GLM-5.3:NVFP4、E2M1、KV cache 与并发影片 ・ 五道口纳什 ・ 23 分鐘 ・
這個來源最近的內容
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)
