雙 RTX 4090 跑本地 AI 代理極限在哪?llama.cpp 三週併發測試與效能瓶頸分析
非營利組織 CTO 長達三週實測雙 4090 執行本地程式碼代理的併發極限與軟硬體調校數據,極具參考價值。
• 作者在 2張 RTX 4090(44.6 GiB 可用 VRAM)的硬體環境下,利用 llama.cpp 對多款模型與量化版本進行了長達三週的併發基準測試,探討本地 AI 代理的最佳規模。
• 測試發現當處理 64k 上下文時,系統的 軟上限為 5 個代理,硬上限為 9 個代理,盲目增加代理數量並不會提升總體吞吐量,反而會使等待時間大幅拉長。
• 總體預填充吞吐量穩定在每秒約 1,500 個 Token 左右,因為系統僅有一個預填充預算,插槽會分散而非乘以該預算。
• 透過對比不同量化版本,作者最終選定 UD-Q6_K_XL 模型搭配 q8_0 KV 快取,在 5 個併發代理下能維持最佳的權重保真度與 VRAM 裕度。
• KV 快取 型態必須一致(如皆使用 q8_0),混合設定(如 f16 與 q8_0 混用)會導致預填充階段嚴重卡死。
• 作者將本地模型透過 MCP 伺服器 整合至工作流中,專門處理高 Token 消耗但風險較低的檔案查詢與程式碼初稿編寫,藉此節省 API 預算。
「增加代理到一定程度後完全買不到任何效能提升,只會買來延遲。」
來源:r/LocalLLaMA
閱讀原文 ↗