Cursor 推出自我總結訓練法:讓 AI 代理突破極限,征服複雜的超長程編程任務

探討透過自我總結(self-summarization)訓練長視野編程任務,有助理解 agent 訓練方法

• 隨著 AI 代理處理的任務日益複雜,**代理軌跡(agent trajectories)的增長速度遠超過模型的上下文長度極限,導致資訊遺忘與效能下降。 • Cursor 團隊為 Composer 模型引入了名為自我總結(self-summarization)的強化學習訓練過程,將上下文壓縮納入訓練迴圈中。 • 傳統的基於提示詞的壓縮方法需要數千個標記且容易丟失關鍵資訊,而受過訓練的 Composer 能以極高的標記效率(token-efficient)自動萃取核心內容。 • 實驗顯示,自我總結機制不僅將壓縮誤差顯著降低 50%,還能重複利用 KV 快取,僅需原本五分之一的標記量。 • > 透過自我總結,Composer 能夠在長達數百個回合、涉及超過十萬個標記的複雜工程任務中,自主提煉出結構化的對話摘要,成功解決如 Terminal-Bench 等高難度問題。 • 這項技術大幅拓展了語言模型的潛能,讓 AI 能夠一次性搞定需要長推理鏈(long reasoning chains)**的極端程式設計挑戰。


來源:Cursor Blog

閱讀原文 ↗

標籤:#cursor

← 回首頁