Cursor Composer 2 技術報告:代理式軟體工程程式碼模型的訓練與效能
Cursor 發布 Composer 2 的技術報告,涵蓋訓練過程細節,包含繼續預訓練和大規模強化學習,這對關注模型底層技術的開發者有幫助。
這份技術報告深入探討了 Composer 2 的訓練歷程,這是一款專為代理式軟體工程打造的程式碼模型。其訓練分兩階段:首先是對開源基礎模型 Kimi K2.5 進行持續預訓練以深化程式碼知識,接著透過大規模強化學習(RL)來優化端到端代理效能,過程中強調緊密模擬真實 Cursor 環境。研究發現,降低預訓練損失能有效提升下游 RL 表現。為解決公開基準的局限性,團隊開發了 CursorBench,一個基於真實程式碼會話的評估基準,確保模型與實際開發問題保持一致。 • 在 CursorBench 上,Composer 2 表現優異,取得 61.3 分,較 Composer 1.5 提升 37%,與頂尖模型具競爭力。 • 在 SWE-bench Multilingual 和 Terminal-Bench 等公共基準上,分別獲得 73.7 和 61.7 分,且具備顯著較低的推論成本。
模型在精度與成本之間實現了帕雷托最優權衡,極適合互動式開發者工作流程。 訓練 Composer 2 涉及大量基礎設施開發,包括用於 Blackwell GPU 的高效能 MoE 訓練核心、跨區域非同步 RL 管線以及內部運算平台 Anyrun。
來源:Cursor Blog
閱讀原文 ↗