實測 5 款程式碼庫 AI 工具:宣稱省下 60-90% Token 的說法為何破功?
開發者在真實 Django 專案及 SWE-bench 基準上對比多家程式碼工具的 token 節省宣稱,展現誠實踩坑與數據校驗的高信號文章
• 作者在 Claude Code 與 Codex 環境下,針對 5 款程式碼庫檢索工具進行了嚴格基準測試,發現過去宣稱能節省 60% 至 90% Token 的說法普遍誇大。 • 測試結果顯示,表現最佳的工具在 Claude Code 上僅能節省約 15.9% 的 Token,而在 Codex 上則為 34.9%,其餘多數工具僅落在 0% 至 17% 之間。 • 研究發現 AI 代理對工具的呼叫頻率高度依賴 測試框架(Harness) 的行為,例如 Claude Code 會依需求動態載入 MCP 結構,而 Codex 則會預先掛載。 • 各工具在程式碼修改的 生成品質 上沒有顯著差異,其品質差距小於評估工具本身的執行噪聲。 • 在不涉及 LLM 判斷的確定性檢索測試中,能夠建立多層深層上下文的工具展現出較佳的檔案召回率(高達 87.6%)。
作者指出,單一檢索酬載與完整代理工作階段(Session)的節省效果存在巨大落差,評估 Token 節省時應同時計入索引成本與快取效應。
來源:r/LLMDevs
閱讀原文 ↗