Cursor 透過自定義 MXFP8 核心實現 1.5 倍快的 MoE 模型訓練

利用自訂硬體核心加速 MoE 模型訓練的工程技術分享,具高技術深度。

Cursor 團隊在將硬體從 Hopper 升級至 Blackwell (B200) GPU 的過程中,發現 Mixture-of-Experts (MoE) 層是訓練時的主要效能瓶頸。為了突破限制,他們完全從零開始重寫了 MoE 層的 GPU 核心,捨棄所有 CUDA 函式庫依賴,改用純 CUDA 與 PTX 開發。

• 實現了高達 3.5 倍的 MoE 層效能提升,帶來整體模型訓練 1.5 倍的端到端加速。 • 轉用 MXFP8 資料格式 取代 BF16,在幾乎沒有損失訓練品質的情況下大幅降低運算成本。 • 克服了 Blackwell 架構中 Tensor Memory (TMEM) 的特性限制,解決了傳統去量化(Dequantization)與量化開銷過大的難題。

透過深入硬體底層進行最佳化,他們打造出超越目前多數開源替代方案的高效能訓練堆疊。


來源:Cursor Blog

閱讀原文 ↗

標籤:#cursor

← 回首頁