玩家自製四張 P100 顯示卡 LLM 本地運行系統,效能表現亮眼
工程師分享組裝四張 P100 舊伺服器 GPU 跑本地模型的硬體搭建實作紀錄
• 有開發者分享了使用 四張 P100 顯示卡 打造的本地大語言模型(LLM)硬體系統。 • 目前系統在實際運行時,產出速度可達 50 token/s,而提示詞處理效能(PP)則維持在 530 至 550 之間。 • 作者計畫未來在標準機箱內擴充至 六張 P100 顯示卡,目前正在等待剩餘硬體到位。 • 社群內也同步探討了本地 AI 工作站的硬體選擇,包含高階專業卡(如 RTX 6000 Ada)與消費級旗艦卡(如 RTX 5090)的效能與功耗取捨。 • 針對多卡串聯方案,使用者需額外考量 PCIe 通道數、主機板支援度以及高額的 整體功耗 等潛在效率瓶頸。 • 此外,部分開發者也在評估升級高容量記憶體的 Mac 裝置(如 M1 Ultra 128GB),以利在工作流程中運行規模更大的模型。
透過高性價比的舊世代伺服器 GPU 進行多卡組合,是打造本地 AI 運算環境的一種經濟實惠方案。
來源:r/LocalLLaMA
閱讀原文 ↗另見:r/LocalLLaMA、r/LocalLLaMA、r/LocalLLaMA