Hugging Face vLLM transformers 後端大躍進:原生速度推理,免手動移植
vLLM 推出高效能的 transformers modeling backend,對開發者提升模型推理速度有直接幫助。
Hugging Face 宣布其 vLLM transformers 模型後端 已獲得重大升級,如今能夠為相容模型提供等同於原生 vLLM 實作的推理速度。
此項重大進展旨在解決模型作者為追求極致性能而需手動移植模型的挑戰,實現了 免移植 即可獲得最佳性能。
其核心技術亮點包括:
• 利用 torch.fx 進行模型圖形分析,在執行時動態應用推理專屬的 層融合 操作。
• 支援如 專家平行化 (EP) 及 張量平行化 (TP) 等高效能平行化策略,並能推斷出相關的平行計畫。
• 經由 transformers 後端處理的模型仍可完全通過 torch.compile 和 CUDA Graphs 進行編譯,且一套程式碼能同時用於訓練與推理。
透過簡單的 --model-impl transformers 旗標,使用者便能在 vLLM 中運行任何 Hugging Face 模型,並無縫整合既有的平行化設定。
文章強調:「當模型作者想要絕對最佳性能時,他們過去仍需編寫自訂 vLLM 實作。現在,transformers 模型後端可動態應用推理專用層融合,與自訂程式碼實現相同速度。」 這項升級為廣泛的 Hugging Face 模型在 vLLM 中實現高效能、原生速度 推理提供了便捷途徑。
來源:Hugging Face
閱讀原文 ↗另見:lobste.rs AI