跳到主要內容
AI 武林
文章高階EN

vLLM Reaches 25K Total TPS/GPU on Qwen3.5

來源 vLLM Blog

讀原文(在新分頁開啟原站)連到 vLLM Blog

摘要

vLLM 團隊分享在 GB200 NVL72 系統上,利用 Blackwell GDN 核、混合快取轉移與無競態非同步排程等最佳化,讓 Qwen3.5-397B 模型達到每 GPU 每秒 25,000 字元的服務效能。文章詳述了針對混合注意力架構的具體實作細節、最佳實踐設定與複現步驟。

vLLM demonstrates achieving 25K TPS/GPU on Qwen3.5 using Blackwell optimizations, hybrid cache transfer, and fixed async scheduling on GB200 systems.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • vLLM 在 GB200 系統上將 Qwen3.5 模型每 GPU 效能提升至 25,000 TPS。
  • 透過 Blackwell GDN 核最佳化與混合快取轉移解決異構模型服務挑戰。
  • 提供包含非同步排程修復與最佳參數設定的完整複現食譜。

提到的工具與公司

  • vLLM
  • Qwen3.5-397B-A17B-NVFP4
  • GB200 NVL72
  • Blackwell GDN kernels
  • HMA
  • NIXL
  • Dynamo

適合誰看

正在開發或最佳化大模型推理服務、熟悉 vLLM 與 NVIDIA 硬體架構的開發者。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)