RTX 5080 與 RTX 3090 雙卡設置:Qwen 3.6 27B Q8 本地推理突破 80 Tok/s
imil.net 分享 RTX 5080 和 RTX 3090 的硬體設置,以實現 Qwen 3.6 27B Q8 的高效能(80 Tok/s),提供了非常具體的硬體配置與效能數據,對想在家中部署大型模型的開發者極具參考價值。
作者分享如何結合 RTX 5080 (16GB) 與 RTX 3090 (24GB) 顯示卡,實現 Qwen 3.6 27B Q8 模型在本地端推論速度達到每秒 80 個詞元以上。為達成此目標,作者進行了一系列關鍵配置:
• 選擇 Asus Prime X570-Pro 主機板 並透過 PCIe 4 riser 卡,將兩張卡設為 2x8 PCIe 通道分割。
• 在 BIOS 中禁用 CSM,啟用 Above 4G Decoding 及 ReSize BAR,並將 PCIe 連接模式設為 Gen 4。
• 使用 nvidia-open 驅動程式 以兼容不同型號的 NVIDIA GPU。
• 編譯 llama.cpp 時,透過 CMAKE_CUDA_ARCHITECTURES="86;120" 同時支援 Ampere 和 Blackwell 架構,並關閉 NCCL。
• llama-server 啟動參數 則利用 --spec-type ngram-mod,draft-mtp 啟用推測性解碼,並透過 -sm tensor -ts 2,3 精確分配模型權重 至兩張顯示卡。
最終,這套優化後的配置成功讓 Qwen 3.6 27B Q8 模型 在約 39GB 的總顯存下,以 80 至 90+ tokens/sec 的高效能運行。
作者強調,檢查 PCIe 連線速度 (
LnkSta: Speed 16GT/s, Width x8) 是驗證雙卡是否全速運行的重要一步。
來源:Hacker News
閱讀原文 ↗