革新 LLM 代理安全性:模型無法直接觸發副作用工具,伺服器透過帳本核准執行
Reddit 用戶構建了一個 agent framework,模型無法直接調用帶有副作用的工具,而是由伺服器透過日誌執行。這是一個關於 AI agent 安全和控制機制的實作分享,強調了『人類在環』的真正實現方式。
• 本文介紹一種創新的 LLM 代理框架,旨在解決現有「人工審核」機制在防範惡意行為上的不足。 • 不同於傳統讓模型在審核後直接執行工具,此框架確保 模型永遠無法直接觸發 具副作用的工具。 • 模型僅能提議執行動作並開啟一個「閘門」;經人工核准後,由伺服器透過行動帳本(action ledger)單次執行真實功能,確保操作的冪等性。 • 這種設計意味著即使提示被越獄,也無法找到從模型到實際行動的執行路徑,大幅提升了執行安全性。 • 作者坦言,此框架雖修復了執行安全,但決策安全仍是弱點,因為人工審核者仍可能錯過模型遺漏的錯誤。 • 另外,模型的讀取端是開放的,提示注入仍可能影響其提議,且無法阻止資料外洩。 • 最後一個考量是,雖然帳本確保了「恰好一次」執行,但副作用本身在程式重啟後仍需保持冪等性。
來源:r/LLMDevs
閱讀原文 ↗