Anthropic 宣告安全突破:Claude Code 的「自動模式」將成為付費方案預設值
Claude Code 將 Auto 模式設為預設值的實務變更與工作流影響
Anthropic 對自家 AI 程式碼助理的安全防護展現高度自信,宣布自 8 月 14 日起,Claude Code 的「自動模式 (Auto mode)」將成為 Pro、Max 與 Team 方案新工作階段的預設設定。過去要求人類頻繁點擊「確定」容易導致確認疲勞 (Confirmation fatigue),反而無法達到真正的安全把關。
• 評測顯示,人類面對危險指令時僅有 13.6% 的拒絕率,而自動模式則能阻擋 89% 的有害操作。 • 根據第三方機構 Trajectory Labs 測試,在 72 種間接提示詞注入情境中,運行自動模式的最新模型成功防禦了所有 720 次攻擊。
「廣泛來說,在 Anthropic 內部幾乎每個人都在使用自動模式。」
然而,作者 Simon Willison 對此仍抱持審慎態度,認為面對如惡意第三方套件等新型態威脅,自動模式是否能全面防範仍需更多獨立驗證。這也提醒開發者在享受 AI 代理高效能的同時,仍須妥善隔離資料與工具權限,以防範未然。
來源:Simon Willison
閱讀原文 ↗