透過專家預判機制,MoE 模型在 SSD 串流與低記憶體 Mac 上的效能提升超過 10%

開發者分享實作 MoE 專家預測(expert-lookahead)快取優化,在低記憶體 Mac 上提升 10% 效能的技術細節。

• 開發者針對低記憶體 Mac 上的 MoE 模型 實作了「專家預判」(expert-lookahead)技巧,搭配 SSD 串流技術(slotstream)成功帶來超過 10% 的效能提升。 • 初始嘗試訓練小型模型來預測 N 層後的專家,但實驗發現 模型自身即為最佳預測器。 • 經過多次實驗,最佳參數設定為 N = 2,在當前計算執行時,系統會提前 2 層運行路由器來預測並載入下一個專家。 • 目前進一步在頂層訓練一個小型校正模型,額外帶來了 約 3-4% 的效能增益。

實驗證實,利用模型自身機制進行超前預載(slotstream),能有效突破硬體限制,大幅優化大型語言模型在資源受限環境下的執行效率。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁