跳到主要內容
AI 武林
文章高階EN

Announcing vLLM AFD Plugin: Disaggregating Attention and FFN for Flexible MoE Serving

來源 vLLM Blog

讀原文(在新分頁開啟原站)連到 vLLM Blog

摘要

vLLM 推出 AFD Plugin,將混合專家模型的注意力與前饋網路分離為獨立服務,支援 NVIDIA GPU 與昇騰 NPU。此實驗性擴展允許兩者在吞吐量與預填充階段獨立擴展,透過聯結器介面實現高效能並行。

vLLM announces an experimental plugin that disaggregates attention and FFN layers for flexible MoE serving on GPU and NPU hardware.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 將注意力與前饋網路分離為獨立服務以支援混合專家模型。
  • 支援 NVIDIA GPU 與昇騰 NPU 硬體,提供同步與非同步執行路徑。
  • 在特定架構下可提升解碼吞吐量並降低首次回應時間。

提到的工具與公司

  • vLLM
  • DeepSeek V2
  • DeepSeek V3.2
  • GLM MoE DSA
  • P2pNcclAFDConnector
  • CAMP2pAFDConnector
  • CAMAsyncAFDConnector
  • Ascend 910C

適合誰看

專注於大規模混合專家模型推理架構、GPU 或昇騰 NPU 伺服器部署的系統工程師與 AI 基礎設施專家。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
0.74

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

這個來源最近的內容

vLLM Blog 的所有內容

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)