提示注入:解讀大型語言模型 (LLM) 的角色認知缺陷
與 #31 重複,Simon Willison 探討 Prompt Injection 的「Role Confusion」角度,是高價值的 Prompt Engineering 討論。
本文提出 提示注入 (prompt injection) 源於 大型語言模型 (LLM) 在辨識不同 角色 (roles) 時的根本缺陷。
• LLM 將所有輸入視為單一連續的 文字串流 (token soup),並仰賴 system、user、think 等 角色標籤 (role tags) 來區分資訊的來源與目的。
• 這些 角色標籤 本應用作離散的控制點,指示 LLM 如何處理特定文本,但其職責常被過度承載,並導致模型產生奇特的行為,例如在 assistant 輸出中否認 think 區塊的存在。
• 當低權限文本(例如被 tool 標籤包裹的網頁內容)被 LLM 錯誤地視為高權限指令(如來自 user 的指示)時,便會發生 提示注入。
• 傳統基於 攻擊記憶 (attack memorization) 的防禦策略效率不彰,因為其僅能應對已知的攻擊模式,面對適應性強的人類攻擊者時極易失敗。
• 相較之下,穩健的防禦機制仰賴 LLM 能正確地執行 角色感知 (role perception),辨識指令的真實來源,而非僅憑內容判斷。
• 深入探究 角色 的科學對於理解 LLM 認知、預測攻擊成功率以及建構更安全的系統至關重要。
來源:lobste.rs AI
閱讀原文 ↗