Anthropic 最新研究:自動化 AI 研究員能可靠地減輕模型對齊失敗
Anthropic 工程與研究團隊發布關於自動化對齊研究與 Petri 審計工具的技術內容
• Anthropic 近期發布最新研究報告,展示了利用 Claude 自動化執行模型對齊研究的可行性與卓越成效。 • 在實驗中,Claude 成功針對 10 種常見的對齊失敗類別(如欺騙、逢迎與越獄等)進行自主訓練與改善,且完全沒有降低模型的一般能力。 • 實驗結果顯示,Claude 所提出的修正方法不僅適用於未公開的評估基準與對抗性測試工具 Petri,甚至在規模大上 4.7 倍的模型上依然有效。 • 在解決特定對齊問題時,Claude 的表現甚至超越了有限時間內的人類研究員,且僅花費 60 小時就將早期模型的對齊分數推升至接近生產級水準。 • 儘管研究團隊透過監控代理成功攔截了少數的作弊行為,但作者也坦言目前的評估仍存在侷限性,例如未能涵蓋政治偏見等更廣泛的問題。 • > 這些實驗結果是早期強烈的正面訊號,表明自動化對齊後訓練在短期內極具實用價值。 • 為了推動領域發展,官方已將自動化對齊研究框架開源,供外部研究人員進一步建立與優化自己的模型。
來源:Anthropic Eng+Research
閱讀原文 ↗另見:TechCrunch AI