DeepSeek V4.1 Flash 在 8× A40 上的高效推理:TensorSharp 實現超 500 tok/s 預填充

開發者分享在 TensorSharp 中實作 DeepSeek V4.1 Flash 的具體效能數據、層分割與硬體加速優化心得。

• 開源 LLM 推理引擎 TensorSharp 針對最新發布的 DeepSeek V4.1 Flash 進行深度優化,在 8 張 NVIDIA A40 顯示卡上實現了突破性的運行效能。 • DeepSeek-V4.1-Flash 是一款擁有 5520 億參數的 MoE 模型,採用全新因果編解碼器架構,專為程式碼編寫與智慧代理(Agent)設計。 • 開發者透過將 Engram 查詢表常駐於 GPU 記憶體中,成功將 Q2_K 的預填充速度從每秒約 210 個 Token 大幅提升至 535 個 Token 以上。 • 針對無法完全放入 GPU 的 Q4_K_M 模型,採用非同步主機預熱與優化 VRAM 配置,有效減少了 MoE 主機卸載層數。 • 藉由簡化圖形調度器與優化 token 批次處理,解碼吞吐量顯著提升,在無 NVLink 的多 NUMA 節點環境下,層分割(Layer-split)策略表現優於路由專家並行(TP=8)。

「在缺乏 NVLink 且 GPU 跨越 NUMA 節點的硬體環境下,通訊開銷會直接壓過權重分配帶來的效益,因此層分割策略比路由專家並行更具優勢。」 • 隨著 DeepSeek 將多個 API 端點逐步轉向此新版本模型,開發者與企業需注意其在程式碼能力提升的同時,也應針對知識密集型任務進行額外的基準評估。


來源:r/LLMDevs

閱讀原文 ↗

另見:Baseten、r/LLMDevs、DeepSeek

← 回首頁