如何在雙節點 DGX Sparks 上將 Qwen3.8-Flash-Next 效能推升至 181 tok/s 總吞吐量
開發者分享在雙節點叢集上成功伺服 Qwen3.8-Flash-Next 支援多代理高吞吐量的極限硬體實測文
• Qwen3.8-Flash-Next 是一款擁有 125B 參數、6B 活躍參數的混合架構多模態 MoE 模型,作為 Qwen4 架構的早期預覽。
• 開發者在雙節點 NVIDIA DGX Spark 叢集上透過 NVMe 記憶體對應與最佳化設定,成功實現高達 181 tok/s 的多代理總吞吐量。
• 透過將 320M 規模的 n-gram 嵌入表 直接從 NVMe 進行記憶體對應(mmap),並結合 madvise(MADV_RANDOM) 設定,大幅降低磁碟讀取放大並釋放寶貴的統一記憶體。
• 部署時利用 vLLM 與 MTP 推測解碼 技術,配合前綴快取(Prefix Caching)達成高達 99% 的命中率,顯著提升實際運行表現。
• 針對硬體資源較受限的消費者級雙 GPU 環境,也能藉由調整 -ubatch 與量化策略在特定硬體上運行此模型。
「透過精細的記憶體配置與 NVMe mmap 技巧,我們能在統一記憶體架構上發揮大模型的最大極限。」
來源:r/LocalLLaMA
閱讀原文 ↗另見:r/LocalLLaMA、Simon Willison、r/LocalLLaMA