Qwen 3.8-27B 任務感知量化技術突破:體積縮小至 15% 卻保有 99% 推理效能

開發者分享自製 Qwen 模型任務感知量化(TAK quant)管線,在保持推理表現的同時大幅縮減模型體積的技術乾貨。

• 作者開發出全新的 TAK (Task Aware Knapsack) 量化技術,成功在特定任務上實現高壓縮比與高效能的平衡。 • 該技術結合了 imatrix 與張量級的記憶體配置,在位元預算內最佳化模型表現。 • 經過測試,TAK 量化後的 Qwen 3.8-27B 模型在推理基準測試中達到 82.81% 的成績,表現超越業界標準的 Unsloth。 • 此方法不涉及模型剪枝、微調或模型合併,純粹透過 imatrix 與損傷分配 流程來達成。 • 實驗結果涵蓋 Qwen 與 Gemma 等多種密集與 MoE 架構,證實任務感知精度配置在推理領域的可行性。

「這些結果給了我強烈的證據,證明任務感知精度分配在推理任務上運作得非常良好,我很高興能將這套管線擴展到編程和數學等其他領域。」 • 目前此技術在編程領域可能會遇到重複循環的問題,作者已計畫進行調查並將管線推廣至更多應用場景。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁