超越單次提示詞:EvoCode-Bench 如何評估 AI 程式碼代理的多輪迭代能力

深入探討程式碼 Agent 在長期任務中的迴歸問題與評測基準,對開發者評估 Agent 穩定性很有實戰參考性。

傳統的單輪程式碼評估往往高估了 AI 的實際可靠性,因為真實開發往往涉及持續的迭代與需求變更。全新多輪基準測試 EvoCode-Bench 透過持續性工作空間、動態演進的需求規格與累積性測試,全面考驗 AI 在複雜專案中的表現。

持久性工作空間讓容器保留跨回合的程式碼與架構決策,而演進式規格則會隨時引入新需求或推翻先前的假設。 • 研究顯示,即使是頂尖模型在多輪互動下的表現也會顯著下滑,而高達 57% 的失敗發生在模型從乾淨狀態本可輕鬆解決的回合中。 • 回歸錯誤(Regressions)是目前最大的瓶頸,AI 往往在實作新功能時不小心破壞了原本正常運作的舊邏輯。 • 測試發現,會主動利用持久性文件追蹤需求的代理,其成功率能夠翻倍成長,顯示結構化管理比單純的模型能力更重要

當需求逆轉先前決策時,連頂尖模型也難以應付;AI 代理真正的挑戰不在於「寫不出新功能」,而在於「無法維持既有功能」。


來源:Phil Schmid

閱讀原文 ↗
← 回首頁