BeeLlama.cpp v0.4.1 發布:引入 KVarN 與 KV 精度尾部,大幅節省 VRAM 並提升效能

llama.cpp 分支實作 KV cache 量化新功能(如 KVarN)的深度技術分享,附帶 VRAM 優化數據,對本地跑模型者極有實戰幫助

BeeLlama.cpp v0.4.1 是基於 llama.cpp 的分支版本,專注於擴展 KV 快取量化 功能,並透過基準測試驗證其成效。 • 新增 KVarN(變異數歸一化 KV 快取量化)技術,在大幅降低效能與記憶體損耗的同時,維持極高的位元精確度。 • 引入 KV 快取精度尾部(Precision Tail),允許將指定數量的近期 Token 以 BF16 或 F16 無損儲存,防止模型誤讀任務細節。 • 支援更多標準 KV 快取類型(如 q6_0q6_1q2_0-q3_1),提供更靈活的精確度與 VRAM 平衡方案。 • 基準測試顯示,搭配 1024 尾部的 kvarn5 與 q6_0 在效能表現上已能媲美 q8_0,但只需消耗少得多的 VRAM。

藉由混合精度 KV 快取與創新量化演算法,開發者能在極限顯存下獲得接近無損的模型輸出表現。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁