vLLM 推出分層 KV 快取卸載架構:突破 GPU 記憶體瓶頸、實現跨節點高效共享
vLLM 引入分層 KV 快取卸載框架,有效降低重算並擴展服務容量,對 LLM 推論部署很有價值。
• vLLM 引入全新的分層 KV 快取卸載(Tiered KV Cache Offloading)機制,有效解決長上下文與多輪對話所產生的龐大 KV 快取負擔。 • 核心設計採用主機為中心(Host-Centric)的架構,所有 KV 資料皆透過 CPU DRAM 進行流轉,讓 GPU 記憶體能享有極速釋放與隨需分配(just-in-time allocation)的優勢。 • 系統支援檔案系統、物件儲存(S3)與點對點(P2P)等多樣化的次級快取層,能將資料跨節點共享,實現水平擴展與快取預熱。 • 透過標準化的記憶體佈局(Canonical Memory Layout),成功解決不同平行化設定與注意力後端之間的格式差異,讓不同節點能直接共享 KV 資料。 • 完美支援預填充與解碼分離(Prefill/Decode disaggregation)以及負載平衡,透過彙整 I/O 大幅提升網路吞吐量與降低首字延遲。 • > 「快取卸載與重載機制不僅大幅節省運算資源與降低延遲,更有效提升叢集的實際服務容量。」 • 框架無縫整合 vLLM 的混合式記憶體配置器,透明支援 DeepSeek V4 與 GLM 5.3 等最新穎的混合式模型架構。
來源:vLLM Blog
閱讀原文 ↗