AI 代理評測盲點:當使用者不再提供完整提示詞,任務成功率從 100% 暴跌至 60%

深度分享在代理評估中引入模擬用戶(只在被問時才回答)對任務成功率與成本的顯著衝擊,極具實戰價值。

• 傳統的 AI 代理評測 多半使用提供完整細節的完美提示詞,這與真實世界的使用情境存在落差。 • 開發團隊在評測系統中加入 模擬使用者,讓其掌握需求但「只在被詢問時才回答」,藉此測試真實互動。 • 實驗結果顯示,在 5 個測試任務中,完整提示詞的成功率高達 100%,而模擬互動使用者的成功率則驟降至 60%。 • 互動模式下的失敗主因在於 代理未主動釐清需求,導致建構出錯誤的成果,同時成本暴增 44%。 • 在另一個雖成功但更複雜的任務中,成本與執行時間分別飆升了 106% 與 199%。

單一提示詞的評測完全無法看出這些潛在的對話缺陷、時間成本與金錢浪費。 • 作者最後呼籲社群應重視並測試 資訊保留型使用者 或真實的對話互動模式。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁