僅用單一小型模型訓練的「輔助系統」,顯著提升多款 LLM 在 Terminal-Bench 上的表現
r/LLMDevs 上分享了如何訓練 harness 以提高 LLM 在 Terminal-Bench 上的得分,這種方法論和實作經驗對 Prompt Engineering 和 Agent 開發者非常寶貴。
• 本文介紹一個創新的 「輔助系統」訓練框架,旨在提升大型語言模型(LLM)的效能。 • 這個 輔助系統 涵蓋提示詞、工具使用、上下文管理及修復循環等多種機制,並將 LLM 本身凍結,僅針對 輔助系統 進行訓練與優化。 • 令人矚目的是,作者僅在一個 小型 Qwen 3.6 35B 模型 上訓練該系統,便成功應用於多個其他 LLM。 • 訓練後的 輔助系統 顯著提升了 DeepSeek v3.2、GPT-OSS 20B/120B 及 MiniMax M2.5 等模型的 Terminal-Bench 2.0 分數。 • 此成果甚至 超越了官方 Terminus 2 輔助系統 的表現,展現了卓越的 跨模型泛化能力與任務環境間的遷移性。 • > 作者提到,此框架被設計為類似 PyTorch 的通用訓練機制,用以解決普遍性問題,並從早期版本中學習到 確定性 的重要性。 • 目前該框架支援 OpenAI 相容 API,可與 Terminal-Bench 或 SWE-Bench 任務對接,並易於擴展至其他任務環境。
來源:r/LLMDevs
閱讀原文 ↗