vllm-metal 發布:在 Apple Silicon 上實現高效能並發模型服務

vLLM 針對 Apple Silicon 的平臺遷移與併發推理優化技術

• vllm-metal 將 vLLM 的 V1 排程器、分頁 KV 快取(Paged KV Cache)以及 OpenAI 相容的伺服器引入 Apple Silicon,並由 MLX 與 Metal 負責底層運算執行。 • 透過支援 分頁變長度注意力核心(paged varlen Metal kernel) 與查詢打包技術,系統能完美處理複雜的批次與多代理程式(Multi-agent)並發請求。 • 內建的 記憶體防護機制(memory guard) 允許開發者透過參數精準設定推理預算,同時限制快取緩衝區,確保 macOS 與其他應用程式的流暢運作。 • 新版本支援 GGUF 格式、混合注意力模型、LoRA 適配器及結構化輸出,大幅拓展 Mac 本地執行的應用範圍。 • > 「在 Apple Silicon 上進行本地推論直到多個請求重疊前都很簡單,但當請求重疊時,首字延遲(TTFT)、記憶體增長與訪問控制便成為主要的服務難題。」 • 效能測試顯示,vllm-metal 在高並發負載下具備極佳的吞吐量與較低的延遲表現,為開發者帶來更穩健的本地 AI 部署體驗。


來源:vLLM Blog

閱讀原文 ↗
← 回首頁