針對 AMD RX 7900 XTX 優化的自訂 llama.cpp 版本:解鎖 Qwen 27B 與 3.8 模型的極致效能

開發者針對 AMD 7900XTX 自製優化版 llama.cpp 的底層硬體效能壓榨實戰(包含 PCIe 頻寬與張量平行),乾貨極多。

• 開發者針對 AMD RX 7900 XTX 顯示卡推出專門優化的 llama.cpp 自訂建置版本,大幅榨出硬體潛能。 • 針對 Qwen 3.8 Next 與 Qwen 27B 模型進行深度調整,在提示詞處理(Prompt Processing)與生成速度上都有顯著提升。 • 引入了 PCIe 資料壓縮技術,即使顯示卡安裝在主晶片組後方的 PCIe x4 插槽,也能透過自訂的 HIP allreduce 路徑實現高效的 Tensor Parallel。 • 包含多項未合併至主流專案的 RDNA3 優化、核心調整、--adaptive-mtp 以及 MoE 專家快取等功能。 • 測試環境基於 Ubuntu 24 與 ROCm 7.14,作者雖不提供後續官方支援,但已將原始碼與詳細說明開源於 GitHub。

「希望這些修改能盡快被主流合併,讓這個科學怪人版本安詳地死去!」


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁