AI 代理人權限審查數據曝光:人類在 4 萬場遊戲中漏掉三分之一威脅
基於 4k 場遊戲數據統計,分析人類審查 AI agent 指令時忽略威脅的比例,具安全防護實戰參考價值。
• 開發者透過一款模擬 AI 程式碼代理人權限審查的小遊戲,分析了超過 4 萬場遊戲與 40 萬次決策數據。
• 數據顯示,平均每位玩家會漏掉 3 分之 1 的威脅,且有 32.9% 的遊戲局數以負分收場。
• 隱藏在常見指令背後(如 npm run analyze)的惡意程式碼成功率暴增,顯示歷史日誌常被使用者忽略。
• 隨著時間推進與時間壓力增加,玩家會出現權限疲勞,導致威脅漏看率再度攀升。
• 過度防範也是一大問題,許多無害的基礎指令(如清除建置目錄 rm -rf dist/)經常遭到誤殺。
「要求使用者驗證幾乎總是安全、但又可能因檔案修改而變得危險的指令,絕對不是一項強而有力的安全防護機制。」 • AI 代理人的安全防護不能單靠人類在迴圈中把關,更需要落實沙盒隔離與憑證分離等實質減災措施。
來源:Hacker News
閱讀原文 ↗