Qwen3.8-27B 最新 SOTA GGUF 模型釋出:採用 GSQ 與 RCO 技術實現極致壓縮
發布針對 Qwen3.8-27B 的新型 GGUF 量化方法 (GSQ+RCO),對模型本地部署有高度實戰價值
• ISTA 實驗室推出了針對 Qwen3.8-27B 的全新量化模型,採用 GSQ(Gumbel-Softmax Quantization) 與 RCO(Riemannian Constrained Optimization) 最新技術。 • GSQ 透過聯合學習網格分配與尺度,大幅縮小了 2 到 3 位元下的純量與向量量化差距。 • RCO 透過梯度下降直接在任務損失上為每個張量分配最佳量化類型,無須繁瑣的逐項約束微調。 • 本次共釋出 2.50、2.75 與 3.00 bpw 三種大小的 GGUF 檔案,容量介於 8.4 至 10.1 GB 並包含視覺投影器。 • 實驗結果顯示,這些模型在同等檔案大小下,效能超越或持平現有的最強量化版本。 • 例如 3.00 bpw 版本在 AIME25 獲得滿分,且在多項基準測試中幾乎追平 BF16 基礎模型。 • 超低位元的 2.75 bpw 版本在 zero-shot 平均表現甚至超越了未量化的 BF16 模型。
團隊表示:「這是我們一系列 SOTA GGUF 發布計畫中的首個成果,未來將擴展至更多模型家族。」 • 所有檔案皆可直接在 llama.cpp、Ollama 與 LM Studio 等主流工具中無縫運行。
來源:r/LocalLLaMA
閱讀原文 ↗