給 AI 彈個 window.confirm:權限、Hooks 與 Human-in-the-Loop 的代理實踐
深入探討 AI 代理的權限分級、確認門與 JSONL 审计日志實作,解決「rm -rf 重試三次成功」的安全性痛點
• 在 AI 代理(Agent)的自動化執行過程中,即使每一步操作看起來都很合理,缺乏人工把關仍可能造成嚴重的覆蓋與刪除災難。 • 核心解法是在模型發出 tool_use 與真正執行之間,引入類似 PreToolUse 中間件的確認機制,將放行權重新掌握在人類手中。 • 權限不是二分開關,而是一道光譜:應將工具分為 allow(唯讀放行)、confirm(副作用操作需人工確認)與 deny(永久拒絕)三級。 • 實作確認門時必須確保三個工程細節:確認要具體到對應的後果、每次操作都必須記錄 JSONL 審計日誌,且採取「白名单預設拒絕」原則。 • > 「拒絕也是一種資訊。」當用戶拒絕操作時,必須透過 is_error 通道 明確回傳原因,否則模型會將沉默視為工具異常並不斷重試。 • 透過 tiny-agent v0.7 的實作,能有效攔截模型未經授權的危險操作與自行編造的工具,保障系統穩定性。
來源:陳廣亮
閱讀原文 ↗