Cursor 團隊推出 Warp Decode:翻轉平行化軸向,實現 1.8 倍更快的 MoE 模型推論
Cursor 團隊分享 MoE 模型推理的底層優化技巧,具備高度開發實戰參考價值
• Warp Decode 是針對 Blackwell GPU 小批次解碼設計的創新 MoE 模型推論方法,打破傳統以專家(Expert)為中心的運算架構。• 透過將平行化軸向翻轉,改為指派每個 Warp 負責單一輸出值(神經元),實現了 1.84 倍的吞吐量提升。• 該技術同時改善了模型準確度,輸出結果比傳統方法更貼近完整的 FP32 參考標準。• 徹底消除了傳統路徑中的填充(Padding)、資料散布(Scatter)與合併(Combine)等 5 個繁瑣的管理步驟。• 移除了啟用快取緩衝區與專家輸出緩衝區,省下每個 Token 超過 32 KB 的記憶體中介流量,釋放寶貴的 L2 快取空間。• 達到完全的 Warp 獨立性,沒有跨 Warp 的同步點或中介緩衝區,讓 GPU 排程器能更有效地隱藏記憶體延遲。> 「核心既能提升效能又能增進準確度非常罕見,而 Warp Decode 正是其中之一。」
來源:Cursor Blog
閱讀原文 ↗