衡量大型語言模型開發漏洞利用能力:Anthropic Mythos Preview 展現重大突破

評估 Claude Mythos Preview 開發漏洞的能力,指出其相較於先前模型有顯著的進步。

Anthropic 最新研究揭示,其 Claude Mythos Preview 模型在開發 軟體漏洞利用 (exploits) 方面取得了突破性進展,相較於前代模型有著顯著提升。該模型不僅能發現複雜漏洞,更能將其轉化為利用原語,並組合成完整的 端對端攻擊鏈 (end-to-end attack chains),引發資安界的廣泛關注。為精確衡量這些能力,研究團隊與學術界合作,採用了更新版 SCONE-bench 以及兩項新開發的更具挑戰性基準測試:ExploitBenchExploitGym

• 在 ExploitBench 針對 V8 引擎的測試中,Mythos Preview 一致超越 (consistently outperforms) 所有其他受評模型。它能可靠地逃逸 V8 沙箱並實現 任意程式碼執行 (Arbitrary Code Execution, ACE),成功率高達 21/41。 • ExploitBench 將漏洞利用開發分解為 16 項能力、5 個層級,從代碼覆蓋到完全控制,自動化評估模型是否能從概念驗證進展到實際危害。 • > ExploitBench 作者之一 Seunghyun Lee 指出:「Mythos 對某些漏洞的利用方式,即便在內部討論時也因其複雜性而被迅速否定,但它卻能乾淨且完美地執行。」 • ExploitGym 則透過評估多達 898 個跨 OSS-Fuzz、V8 引擎和 Linux 核心的已修補漏洞,測試模型在 廣泛目標集 (broad target set) 上的利用能力。

這些評測結果證明,隨著 Mythos 級別能力的普及,開發漏洞利用所需的知識與專業門檻將大幅降低,預示著 AI 在網路安全攻防領域的潛在影響。


來源:Anthropic Eng+Research

閱讀原文 ↗

另見:Anthropic Eng+Research、Anthropic Eng+Research

← 回首頁