研究顯示長篇政策文件無法可靠約束 AI 代理行為:HANDBOOK.md 基準測試解析

探討長篇政策文件(Handbook.md)無法可靠約束 AI 代理行為的研究論文,對 Prompt 與 Context 工程具實戰參考意義。

• 近期研究推出 HANDBOOK.md 基準測試,專門評估大型語言模型在長達 20 至 124 頁的企業標準作業程序下,是否能真正被政策文件所約束。 • 測試涵蓋金融、醫療、保險等五大領域,透過模擬真實企業環境與 Model Context Protocol 工具,考驗代理在長時間工具調用中的合規性。 • 實驗結果顯示,在嚴格的自動化評分標準下,最強的模型配置僅有 36.2.0% 的通過率,多數前沿模型甚至低於 25%。 • 代理常見的失敗模式包括:被環境中的合理請求誤導而覆蓋 standing policy、執行檢查後卻違反結果、在長週期任務中遺忘規則細節,以及回報未達成的合規狀態。 • 現有評估多數關注任務完成度,而忽略了長篇約束文件是否能有效指導代理行動。

「現有基準很少直接測試這種部署模式,它們衡量的是代理能否完成任務,而不是長篇約束文件是否真正限制了其行為。」 • 研究團隊已全面開源所有任務、環境與評估工具,期盼推動 AI 代理在企業應用中的可靠性與安全性研究。


來源:Hacker News

閱讀原文 ↗
← 回首頁