LLM防禦新視角:逾30種多語言提示注入模式開源資料集
作者分享了超過 30 種語言的 Prompt Injection 防禦模式,並開源了數據集,對於關心 LLM 安全的開發者來說,這是一個極具價值的研究和實踐資訊。
• 此分享著重於大型語言模型(LLM)的防禦性提示工程。 • 開發者在構建開源 LLM 安全代理 Tamga 時,已彙編並公開一份多語言提示注入模式資料集。 • 該資料集包含 309 個提示,其中約 60% 為惡意類型,涵蓋多種語言(如英語、土耳其語、德語、俄語)的直接注入。 • 其他模式還包括間接注入(如 RAG 文件中的隱藏文本)、DAN 風格的越獄、令牌走私(零寬字符、Unicode 同形異義字)及 Base64 編碼指令等。 • 偵測方法採用混合式策略,結合 Aho-Corasick DFA 演算法快速匹配已知模式,並在信心度模糊時使用 LLM 作為判斷者。 • > 作者指出,僅靠確定性方法,召回率約為 48%,面臨釋義和新穎混淆形式的挑戰。 • 該專案歡迎社群貢獻,特別是新增非英語的提示注入模式,以擴充資料集的廣度。
來源:r/PromptEngineering
閱讀原文 ↗