Anthropic 宣告安全突破:Claude Code 的「自動模式」將成付費方案預設值

Simon Willison 整理 Claude Code 將 Auto 模式設為預設的動態與官方說明

• Anthropic 對 Claude Code 自動模式(Auto mode)極具信心,宣布自 8 月 14 日起,Pro、Max 與 Team 方案的新工作階段將全面預設開啟此功能。 • 根據官方公布的評測數據,在面對刻意偽裝的危險指令時,一般人類測試者的拒絕率僅有 13.6%,而自動模式則能阻擋高達 89% 的危險動作。 • 第三方安全機構 Trajectory Labs 針對 72 種間接提示詞注入情境進行測試,結果顯示運行自動模式的 Claude 最新模型成功抵禦了所有攻擊嘗試。 • 作者 Simon Willison 指出,要求人類頻繁點擊確認會導致確認疲勞,自動化防護在概念上確實比盲目依賴人工審核更為安全。 • > 「儘管官方數據令人驚艷,但面對如惡意第三方套件等新型態隱蔽攻擊,我們仍需尋求更多獨立安全確認。」 • 專家呼籲,即使AI代理的安全性大幅提升,開發者仍應落實權限隔離,確保代理無法存取一旦被觸發就會造成重大危害的敏感資料或工具。


來源:Simon Willison

閱讀原文 ↗

標籤:#claude-code

← 回首頁