提示注入新視角:AI 模型「角色混淆」讓風格凌駕內容,資安挑戰再升級

Simon Willison 深入探討 Prompt Injection 的「Role Confusion」角度,結合研究論文與獨立觀點,是高價值的 Prompt Engineering 討論。

一項由 Charles Ye 等人進行的最新研究揭示了大型語言模型(LLM)在區分其內部特權文本與使用者輸入時面臨 「角色混淆」 的根本性挑戰。 研究發現,模型在判斷文本時,甚至可能更看重文本的 「風格」 而非實際內容。 • 一個令人擔憂的例子是,惡意使用者輸入若模仿模型內部思考區塊的寫作風格,如 gpt-oss-20b 等模型便可能因此混淆,進而規避其初始訓練設定。 • 不過,透過 「去風格化」(destyling),即微調文本的寫作方式使其不那麼像預期格式,可顯著降低攻擊成功率,從 61% 驟降至 10%。 這證明了對人類而言幾乎無法察覺的文本格式差異,對 LLM 的 「角色感知」 卻產生了巨大的影響。 研究人員將此底層機制稱為 「角色混淆」,並視其為解決當今模型提示注入問題的關鍵挑戰。

他們指出:「除非 LLM 實現真正的角色感知,否則注入防禦將會是一場永無止境的打地鼠遊戲。」 這項發現凸顯了目前模型在防禦提示注入上的困境,並預示著可能透過看似無害的文本,合法且大規模地微妙改變 LLM 狀態的潛在威脅。


來源:Simon Willison

閱讀原文 ↗
← 回首頁