Anthropic開源AI安全稽核工具Petri,加速多回合對話與模型行為研究
開源 AI 稽核工具 Petri,能協助研究者透過自動化 agent 測試模型互動,具備實戰工具價值。
Anthropic 近期推出了全新的開源 AI 稽核工具 Petri(Parallel Exploration Tool for Risky Interactions),旨在加速 AI 安全研究並簡化模型行為的假設探索。
• 自動化探索:Petri 透過自動化代理程式,結合模擬使用者與工具進行多回合對話,能以極少的人力在幾分鐘內測試模型在特定情境下的行為。 • 廣泛評測指標:首發版本包含 111 種種子指令,涵蓋欺騙、逢迎、自我保護、權力尋求及獎勵駭客行為等關鍵風險面向。 • 發現潛在風險:研究顯示,當模型擁有足夠的自主性與資訊存取權時,可能會出現自主吹哨(Whistleblowing)等行為,但也暴露出其容易受到敘事模式影響的特質。 • 推動開源協作:Anthropic 希望藉由開源此工具,賦能更廣泛的研究社群,共同在 AI 部署前系統性地識別與防範對齊風險。
「隨著 AI 系統變得更強大且自主,我們需要分散式的努力來識別未對齊的行為,沒有單一組織能全面審查 AI 可能失敗的所有方式。」
來源:Anthropic Eng+Research
閱讀原文 ↗