跳到主要內容
AI 武林
文章高階EN

PD Serving of Qwen3.8-2.4T

來源 vLLM Blog

讀原文(在新分頁開啟原站)連到 vLLM Blog

摘要

介紹如何在 GB300 NVL72 叢集上,使用 vLLM 對 Qwen3.8-2.4T 模型進行 PD 服務最佳化,達成每秒 5000 總 token 吞吐與 180 生成 token 使用者互動。文章詳解從 KV Cache 估算、CUDA Graphs 記憶體規劃到並行配置決策的完整除錯流程,並提供可重現的 srt-slurm 指令碼。

This blog post details optimizing PD serving for Qwen3.8-2.4T on vLLM using GB300 NVL72, achieving 5K throughput and 180 interactivity with reproducible tuning recipes.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 在 GB300 NVL72 叢集上對 Qwen3.8-2.4T 模型進行 PD 服務效能測試。
  • 詳細拆解從 KV Cache 估算到 CUDA Graphs 記憶體規劃的最佳化步驟。
  • 提供可重現的 srt-slurm 指令碼與完整 Pareto 曲線資料。

提到的工具與公司

  • vLLM
  • Qwen3.8-2.4T
  • GB300 NVL72
  • AIPerf
  • Dynamo
  • CUDA graphs
  • NVLink72

適合誰看

負責大模型推理服務架構設計、效能調優或需要部署 Qwen3.8 系列模型的工程師。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
0.93

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)