vLLM AFD 外掛登場:解耦注意力與前饋網路,實現 MoE 模型彈性服務
vLLM AFD Plugin 介紹了 attention 和 FFN 的分離,以支援 Mixture-of-Experts (MoE) 模型,對模型服務架構有技術價值。
vLLM 正式推出實驗性的 AFD (Attention-FFN Disaggregation) 外掛,旨在將注意力機制(Attention)與前饋網路(FFN)在 Mixture-of-Experts (MoE) 模型中分離為獨立部署的服務。 這項創新使得 Attention 和 FFN 路徑能夠獨立擴展,有效解決了兩者在擴展需求、執行職責和通訊方式上的差異。 • 外掛維持了 vLLM 現有的請求生命週期與相容 OpenAI 的服務介面,並透過其獨特的架構設計,將 vLLM 的排程器和 KV 快取保留在 Attention 服務中,而 FFN 服務則作為輕量級連接器驅動的守護程式運行。 • 核心設計包括 Attention 服務、FFN 服務及一個抽象的連接器層,確保各後端(如 NVIDIA GPU 和 Ascend NPU)能實作各自的通訊與運行時最佳化。 • 目前支援 DeepSeek V2/V3 系列模型,並提供同步 AFD 以提升解碼吞吐量,以及非同步 AFD 以優化預填充(prefill)效能。
作者指出,「解耦本身並不能保證吞吐量增益,Attention 到 FFN 的配置至關重要」。 初步效能測試顯示,在特定配置下(如 64A16F),AFD 能帶來高達 11.3% 的吞吐量提升,但其他配置則可能低於基準線。此專案仍處於實驗階段,需更多大規模測試驗證其穩定性與性能。
來源:vLLM Blog
閱讀原文 ↗另見:vLLM Blog、vLLM Blog