驚人發現:未微調 27B 模型在代理任務中擊敗微調 75B 模型

比較了 27B 和 75B 模型作為 agent 的表現,指出少輪次(fewer turns)比快 token 更重要,並附帶了具體配置和測試結果,這是關於 agentic agent 設計非常深刻且實用的見解。

未經微調的 Qwen3.6-27B-INT8-AutoRound 模型 在代理任務中,顯著超越了經過手動微調的 Nemotron Puzzle-75B-A9B NVFP4 模型。 • 27B 模型僅需 6-9 次工具呼叫,用時 134-190 秒即可完成所有任務,且無需任何調校。 • 相較之下,75B 模型即使經過手動微調,仍需 13-23 次呼叫,耗時 221-384 秒,顯示其效率較低。

作者指出,「對代理而言,更少的執行步驟勝過更快的令牌生成速度」,浪費更少步驟的模型最終會勝出。 • 測試中曾遭遇因 前綴快取 (prefix caching) 的問題,導致代理執行時工具呼叫的 XML 可能會損壞。 • 解決方案是在系統提示中加入每次運行獨有的隨機碼,以確保測試樣本的獨立性並避免重複錯誤。 文章也建議 Ampere 顯卡用戶應嘗試 vLLM 整合 NVFP4 和 INT8 的新功能,認為這比 llama.cpp 更有優勢。


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁