Warp 推出 Factory Benchmarks:打造專屬你的 AI 程式碼模型評測工具
Warp 推出代理評估基準測試工具,直接協助開發者在自身程式碼上測試與優化 AI 效能。
• Warp 於 Warp Factories 搶先體驗版中推出全新 Benchmarks 功能,讓開發團隊能在自身的真實程式碼任務與情境上,直接測試與評估不同的 AI 模型和技能配置。 • 該功能與 SWEBench 等公開評測類似,但核心優勢在於使用團隊自有任務與上下文,支援多種前沿與開源模型,未來更將擴展至不同代理框架(harness)。 • 系統背後透過 factory.yaml 程式碼定義工廠狀態、自動儲存完整的代理執行足跡(traces),並內建 LLM-as-a-judge 評分器(Scorers) 來衡量成本、品質與正確性。 • 透過實際的基準測試,Warp 團隊已成功在特定類型的任務中,將內部成本大幅降低 63% 且不影響品質。 • 測試完成後,開發者可利用自訂模型路由器(custom model routers),依據分類動態挑選出最適合該任務的 AI 模型配置。
「Benchmarks 與自我改進(self-improvement)是推動 AI 程式碼代理系統從『憑感覺運作』邁向『工程化系統優化』的兩大關鍵核心能力。」 • 目前符合資格的團隊可申請 Warp Factories 的搶先體驗,並獲得價值一萬美元的工廠使用額度。
來源:Warp Blog
閱讀原文 ↗