讀原文(在新分頁開啟原站)連到 vLLM Blog
摘要
vLLM 宣佈對 Qwen3.8-2.4T-A95B 模型實現 Day 0 支援,提供 FP8、BF16 及 NVFP4、MXFP4 量化權重。文章介紹了該混合 MoE 架構的細節、在 NVIDIA 與 AMD 硬體上的最佳化核心,以及部署與效能測試結果。
vLLM announces Day-0 support for the massive Qwen3.8-2.4T-A95B model with multiple quantization options and hardware optimizations from NVIDIA and AMD.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- vLLM 對 Qwen3.8-2.4T-A95B 模型實現 Day 0 即時支援。
- 提供 FP8、BF16 及 NVFP4、MXFP4 多種量化檢查點。
- 與 NVIDIA 和 AMD 合作開發最佳化核心以提升效能。
提到的工具與公司
- vLLM
- Qwen3.8-2.4T-A95B
- NVIDIA B300
- AMD MI355X
- NVFP4
- MXFP4
- hipBLASLt
- AITER
適合誰看
正在尋找大規模開源模型部署方案或需要高效能推理架構的開發者。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.80
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- vLLM Reaches 25K Total TPS/GPU on Qwen3.5文章 ・ vLLM Blog
- PD Serving of Qwen3.8-2.4T文章 ・ vLLM Blog
- 8G 显存竟能跑 125B 大模型!内存硬抗 Qwen3.8-Flash-Next,N卡、A卡都能用!本地部署实测 | 零度解说影片 ・ 零度解说 ・ 10 分鐘
- 本地部署Qwen 3.8 27B,要用什么配置影片 ・ huangyihe
- Qwen3.8-27B 正式开源!越狱无审查!最低 8GB 显存就能跑,媲美顶级闭源模型?本地部署实测 | 零度解说影片 ・ 零度解说 ・ 11 分鐘
- Qwen3.8-2.4T-A95B now available on Modal文章 ・ Modal Blog
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)
