研究揭露主流 LLM API 漏洞:可透過越獄手法竊取加密的思考過程
探討如何從專有 LLM API 竊取推理痕跡的安全漏洞研究,技術細節引人深思。
• 近期安全研究指出,Anthropic、OpenAI 與 Google 等業者回傳給用戶的加密推理鏈(Chain-of-Thought)區塊存在安全漏洞。 • 攻擊者可將強大模型產生的加密思考區塊,重新餵給同系列中較弱的模型(如 Claude Haiku),並透過越獄提示詞(Jailbreak)成功解密並還原出原始的隱藏推理過程。 • 這些被洩漏的思考 Token 從未預期公開,內容包含模型處理 CSS 架構等雜亂的內部運作細節,揭露了前沿模型的底層運作樣貌。 • 研究人員還發現一種新型的提示詞注入變體:誘使模型在其思考追蹤中納入外洩資料的指令,再將該加密思考回放給其他模型,由於模型通常會將自身的推理視為絕對權威,因而極易中招。 • > 所有相關模型供應商在接獲通報後皆已進行修復,目前已無法再發動同類型的攻擊。
來源:Simon Willison
閱讀原文 ↗另見:Hacker News