AI 代理評測不應混淆任務成功與系統可靠性
強烈呼籲代理基準測試應將「任務成功率」與「運行可靠度/恢復成本」分開評分的實戰方法論。
• 目前多數 AI 代理(Agent)評測過度依賴單一的通過/失敗率,因而掩蓋了本質截然不同的兩種失敗模式。 • 作者指出,評測應當將任務成效(Outcome)與系統可靠性(Reliability)分開計分,避免將額外成本與延遲混淆判定。 • > 「無例外」並不等於成功,若代理聲稱郵件已發送但收件匣空空如也,外部狀態驗證才是關鍵。 • 運作過程中經歷錯誤但最終恢復的執行個體,其代價應該反映在資源浪費與關鍵路徑時間上,而非直接判定失敗。 • 對於執行長跨度工具呼叫的複雜任務,釐清混亂路徑與正確結果的界線,是優化評測系統的當務之急。
來源:r/LLMDevs
閱讀原文 ↗