RTX 5080 與 RTX 3090 雙卡設置:Qwen 3.6 27B Q8 本地推理突破 80 Tok/s

imil.net 分享 RTX 5080 和 RTX 3090 的硬體設置,以實現 Qwen 3.6 27B Q8 的高效能(80 Tok/s),提供了非常具體的硬體配置與效能數據,對想在家中部署大型模型的開發者極具參考價值。

作者分享如何結合 RTX 5080 (16GB)RTX 3090 (24GB) 顯示卡,實現 Qwen 3.6 27B Q8 模型在本地端推論速度達到每秒 80 個詞元以上。為達成此目標,作者進行了一系列關鍵配置: • 選擇 Asus Prime X570-Pro 主機板 並透過 PCIe 4 riser 卡,將兩張卡設為 2x8 PCIe 通道分割。 • 在 BIOS 中禁用 CSM,啟用 Above 4G Decoding 及 ReSize BAR,並將 PCIe 連接模式設為 Gen 4。 • 使用 nvidia-open 驅動程式 以兼容不同型號的 NVIDIA GPU。 • 編譯 llama.cpp 時,透過 CMAKE_CUDA_ARCHITECTURES="86;120" 同時支援 Ampere 和 Blackwell 架構,並關閉 NCCL。 • llama-server 啟動參數 則利用 --spec-type ngram-mod,draft-mtp 啟用推測性解碼,並透過 -sm tensor -ts 2,3 精確分配模型權重 至兩張顯示卡。 最終,這套優化後的配置成功讓 Qwen 3.6 27B Q8 模型 在約 39GB 的總顯存下,以 80 至 90+ tokens/sec 的高效能運行。

作者強調,檢查 PCIe 連線速度 (LnkSta: Speed 16GT/s, Width x8) 是驗證雙卡是否全速運行的重要一步。


來源:Hacker News

閱讀原文 ↗
← 回首頁