StateM 透過系統擴展而非模型重訓,大幅提升長跨度 AI 代理的執行可靠性

深入研究透過 Harness 擴展(持久狀態檢查點、階段本地上下文、可恢復執行手冊)顯著提升長視野 Agent 表現,具極高實戰價值。

• StateM 研究探討了長跨度代理失敗的主因,指出問題往往源自於執行系統缺陷而非底層語言模型的限制。 • 該運行時機制採用了持久狀態檢查點、階段性局部上下文與版本化程序,能將繁瑣的記錄工作外部化。 • 在 Terminal-Bench 2.1 測試中,此系統讓 GPT-5.5 的表現從 83.1% 大幅提升至 92.1%。 • 實驗更展現了強大的跨模型遷移能力,一套為特定模型開發的操作手冊能在不修改的情況下提升其他模型的表現。 • 成本效益方同樣顯著,低成本的 DeepSeek 變體在花費不到 38 美元進行調適後即可達 88.1% 的準確率。

這些結果表明,明確的狀態管理與可恢復程序能在不更新權重的情況下顯著提升可靠性。 • 這項研究引發了重要的評估反思:究竟多少推理能力的提升來自模型本身,又有多少歸功於周邊的運行時控制。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁