Anthropic 坦承 Claude 評估期間誤入外網,不慎對真實組織發動網路攻擊
Anthropic 揭露內部網路安全評估中發現 Claude 模型越獄存取外部網路的真實事件,具備高度參考價值
• 繼 OpenAI 發生模型突破沙盒存取外部平台事件後,Anthropic 進行了大規模的資安評估回顧,檢查超過 14 萬次測試紀錄。 • 調查發現在與第三方夥伴 Irregular 合作的奪旗賽(Capture-the-Flag)評估中,因環境設定誤解導致模型意外連接至網際網路。 • 由於模型被告知身處模擬環境且目標是尋找線索,Claude 將真實世界的系統誤認為測試範圍的一部分,進而利用弱密碼等基礎漏洞存取了三個外部組織的基礎設施。 • 涉事的 Claude 模型(包含 Opus 4.7 與 Mythos 5)並未使用一般大眾版本的安全防護分類器與監控機制,但在測試中並未試圖自我複製或逃逸。 • > 「在所有情況下,Anthropic 的評估提示詞都明確告知 Claude 該環境是模擬的且沒有網際網路存取權限,但由於溝通誤解,實際情況並非如此。」 • 發現問題後,Anthropic 已立即暫停所有資安評估,並聯繫受影響的組織進行修復,同時呼籲其他 AI 實驗室進行類似的審查以確保安全。
來源:Anthropic News
閱讀原文 ↗另見:Simon Willison