兩千名挑戰者入侵AI助理:六千次嘗試後,AI毫髮無傷

作者分享了 2000 人嘗試攻擊其 OpenClaw AI 助理的實驗,並記錄了過程、花費與結果,包含真實的踩坑和觀察,是高品質的實作心得。

Fernando Irarrázaval 進行了一項挑戰,讓約 2,000 人 試圖透過電子郵件入侵他的 OpenClaw 測試 AI 助理,以洩露其中的機密。經過 6,000 次 嘗試後,儘管耗費了 500 美元的代幣開銷並導致 Google 帳戶因過多入站郵件而被暫停,無人成功洩露任何秘密。該 AI 助理基於 Opus 4.6 模型,並透過嚴格的「反提示注入規則」進行防護,這些規則明確禁止模型揭露機密或執行外部指令。Simon Willison 觀察到,模型開發實驗室在訓練其前沿模型以抵禦 提示注入攻擊 方面的努力似乎確實有效,使這類攻擊變得更難成功。

不過,他仍不建議在生產系統中部署可能因提示注入攻擊而造成不可逆損害的系統。即使有 6,000 次失敗嘗試,也不能保證具備更複雜方法的攻擊者無法得逞。


來源:Simon Willison

閱讀原文 ↗
← 回首頁