23款 Gemma 4-E4B 模型評測:下載量最高的最受歡迎模型竟然完全損壞?

針對多個 Gemma 模型進行 abliterations 基準測試與比較,揭露模型真實表現與差異,具備良好開發者參考價值

• 作者針對 Hugging Face 上的 23 款 Gemma 4 E4B 模型進行了大規模的去障礙(abliteration)與基準測試,揭露各款模型的實際表現。 • 測試結果顯示,下載次數高達近 80 萬次的 OBLITERATUS 模型實際上已經完全損壞、表現墊底,證明大眾容易受到行銷與炒作影響。 • 精細修改、觸碰較少張量(tensors)的去障礙模型(如 heretic 系列)表現最佳,能在保持能力(保留約 95% ASR)的同時達成高安全解除。 • 模仿 Claude 或 Gemini 的推理蒸餾微調(distill fine-tunes)並未提升推理能力,反而破壞了 Gemma 4 原生的推理電路。 • 專案發現了部分模型存在未標註來源的程式碼複製現象,例如位元完全相同的複製品或是相互改版的變體。

「就像這次評測所顯示的,越精細、改動越少張量的去障礙方法,才是真正的贏家。」


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁