DeepSeek V4.1 Flash 在 M3 Ultra 上的效能優化實戰

開發者分享在 Mac M3 Ultra 上優化 DeepSeek V4.1 Flash 本地推理與 agent 運行的詳細參數與踩坑紀錄。

• 開發者針對 Apple M3 Ultra 晶片對 DeepSeek V4.1 Flash 模型進行深度優化,透過客製化 ds4 分支大幅提升執行效率。 • 在 Q4 量化權重下,8k 上下文的解碼速度從 16.6 t/s 顯著提升至 31.3 t/s,300k 長文本表現更達到 28.3 t/s。 • 核心優化包含減少指令分派次數、優化 Metal GEMM 與 Engram 磁碟等待,並大幅改善多 Token 預測(DSpark MTP)的吞吐量。 • 引入 DSpark 技術與智慧流量控制,使序列解碼升級為 6 行矩陣乘法,同時維持與上游完全一致的位元級準確度。 • 實作了基於磁碟的 KV 快取 快照機制,將冷啟動的 31 秒等待縮短至 0.23 秒。

「沒有任何優化是犧牲模型品質換取速度的,所有核心產出的數學結果都與上游完全一致。」 • 目前此優化分支僅支援具備 512 GB 記憶體的 M3 Ultra 機器,並高度依賴該晶片的雙晶粒記憶體與 80 核心 GPU 特性。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁