跳到主要內容
AI 武林

vLLM Blog

部落格 ・ 國際 ・ 英文 ・ A 級 ・ 30 筆內容 ・ 最近更新 2026/10/07

開源推論引擎的工程部落格:新模型的部署調校、分離式服務架構、吞吐量最佳化

最受歡迎

依人氣

  1. 7文章高階EN

    Tiered KV Cache Offloading in vLLM

    介紹 vLLM 的階層化 KV Cache 離線架構,說明如何將資料移至主機記憶體、檔案系統或遠端節點以減少重計算。讀者可了解其主機中心設計原理、不同離線層級運作方式及效能提升機制。

  2. 9文章高階EN

    Watermarking in vLLM

    介紹 vLLM 如何透過 Gumbel-max 技巧與高效 GPU 核,在不改變模型輸出分佈的前提下實現文字水印。讀者可了解其原理、檢測機制及與推測解碼的整合方式,並掌握效能影響與挑戰的解決方案。

最新內容

依發布時間

  1. 文章高階EN

    Taking vLLM Apart: A Practical Guide to Disaggregated Serving

    詳細介紹如何在 vLLM 中實作解耦式服務,將提示處理(prefill)與生成(decode)分開,並將前端處理移至 CPU。透過分離這些階段,可以有效降低長提示造成的延遲,提升系統在生產環境下的有效吞吐量與延遲表現。

  2. 文章高階EN

    Watermarking in vLLM

    介紹 vLLM 如何透過 Gumbel-max 技巧與高效 GPU 核,在不改變模型輸出分佈的前提下實現文字水印。讀者可了解其原理、檢測機制及與推測解碼的整合方式,並掌握效能影響與挑戰的解決方案。

  3. 文章高階EN

    PD Serving of Qwen3.8-2.4T

    介紹如何在 GB300 NVL72 叢集上,使用 vLLM 對 Qwen3.8-2.4T 模型進行 PD 服務最佳化,達成每秒 5000 總 token 吞吐與 180 生成 token 使用者互動。

  4. 文章高階EN

    Tiered KV Cache Offloading in vLLM

    介紹 vLLM 的階層化 KV Cache 離線架構,說明如何將資料移至主機記憶體、檔案系統或遠端節點以減少重計算。讀者可了解其主機中心設計原理、不同離線層級運作方式及效能提升機制。

  5. 文章高階EN

    Optimizing vLLM on Arm CPUs

    介紹 vLLM 在 Arm CPU 上的效能最佳化與功能擴充,涵蓋記憶體分配器、同步機制、權重預打包及量化加速等技術細節。讀者可了解如何提升大型語言模型在 Arm 伺服器上的推論速度與穩定性。