大型語言模型量化衝擊實測:不同能力受損程度差異巨大,結果令人驚訝

系統性測試不同量化等級對 LLM 各項能力(數學、程式碼、推理、知識)的影響,發現結果比預期更細膩,並給出量化選擇的建議,這對於追求模型在本地裝置上平衡效能和資源使用的開發者是非常寶貴的實戰經驗。

• 作者透過系統性測試,比較了 FP16 與各種 GGUF 量化等級對多個大型語言模型不同能力的影響。 • 測試細分了模型的數學(GSM8K)、程式碼(HumanEval)、推理(ARC-Challenge)知識回憶(MMLU-Pro)等能力。 • 結果顯示,量化對這些能力的衝擊程度遠比單一聚合基準分數所反映的要複雜且細緻。 • 一個 27B 模型實測發現,Q4_K_M 量化對對話/知識任務影響輕微(退化不到 2%),但多步驟數學準確性卻大幅下降近 9%。 • Q5_K_M 量化則幾乎彌補了數學能力的差距,突顯出「正確」的量化等級完全取決於模型的特定用途。 • > 作者觀察到社群缺乏關於「特定模型在我的使用場景和硬體下,哪個量化版本最好」的深入數據,儘管有大量「哪個模型最好」的資訊。 • 文中也提到,量化模型是否會比 FP16 版本更快地產生上下文衰減(如在上下文視窗填滿時提早出現幻覺),仍是一個需透過嚴謹測試來解答的關鍵問題。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁