解鎖消費級 NVIDIA 顯示卡 PCI-E P2P:vLLM 效能免費提升 25%
硬體與推論優化技巧:啟用消費級 NVIDIA 顯示卡 PCI-E P2P 以提升 vLLM 推理效能的實戰調校
• 作者在具備 4 張 RTX 5060 Ti 16GB 的伺服器上進行測試,發現為消費級 NVIDIA 顯示卡啟用 PCI-E P2P(點對點通訊) 能帶來意料之外的效能飛躍。
• 透過基準測試數據對比,啟用 P2P 後的 提示詞處理(Prompt Processing) 效能直接提升了約 25%。
• 雖然測試使用了高階的 AMD EPYC 處理器與高頻寬記憶體,但 P2P 技術依然顯著降低了多卡協同的延遲瓶頸。
• 要成功啟用此功能,硬體必須支援 ReBAR 並在 BIOS 中開啟。
• 過程需要安裝特定的開源 GPU 核心模組驅動程式,並在 vLLM 啟動環境變數中設定 NCCL_P2P_DISABLE=0、VLLM_SKIP_P2P_CHECK=1 與 NCCL_P2P_LEVEL=SYS。
作者總結指出,只要完成簡單的韌體與環境設定,就能為多卡大模型推理省下大筆硬體升級開銷,免費獲得顯著的吞吐量成長。
來源:r/LocalLLaMA
閱讀原文 ↗