記憶投毒重創 LLM 代理(70-95%):協同證實閘門能有效防禦嗎?
Reddit 用戶測試『協同門』(corroboration gate) 是否能防禦 LLM agent 的記憶中毒攻擊,發現其成功率高達 70-95%。這是一篇關於 AI agent 安全的實戰測試和研究分享,包含具體方法和結果。
• 針對大型語言模型代理的記憶投毒攻擊成功率高達 70-95%,透過注入惡意「記憶」來引導代理行為。 • 作者進行實驗,測試**「協同證實閘門」作為防禦機制的效果。 • 實驗結果顯示:樸素的記憶儲存(依重要性/新近度排序)在兩種攻擊目標(鞏固投毒、覆寫事實)下,中毒率均達 100%。 • 然而,導入協同證實閘門後,單一來源的投毒攻擊成功率大幅降至 0%。 • > 作者指出,此閘門仍有其限制:「Sybil 攻擊」(偽造多個獨立證實)或以「程序」形式表述的投毒**,仍能成功繞過防禦。 • 因此,在設計代理記憶時,應避免僅依賴重要性或新近度來決定記憶的持久性。 • 建議將記憶持久性與協同證實機制連結,並對程序性寫入也提出證實要求,同時需警惕偽造的證實數量,確保來源獨立性。
來源:r/LLMDevs
閱讀原文 ↗