Anthropic開源自動化行為評估框架 Bloom:加速AI模型對齊與風險檢測

開源自動化行為評估框架 Bloom 的介紹,對開發者在模型行為驗證上具備實戰參考價值。

• Anthropic 推出了全新開源工具 Bloom,這是一個專為前沿 AI 模型設計的代理式行為評估框架,旨在解決傳統評估耗時且易過時的痛點。 • 該框架透過理解、構思、執行與評判等四個自動化階段,針對特定行為特徵自動生成多樣化情境,並量化其發生頻率與嚴重程度。 • 經實驗驗證,Bloom 的評估結果與人工標註高度相關,且能有效區分出基準模型與刻意植入偏差的測試模型。 • 除了標準化評估外,研究人員還利用 Bloom 成功復現了自我偏好偏差的測試結果,發現增加推理能力有助於降低模型的利益衝突。 • 該工具支援高度客製化配置,並可與 Weights & Bisas 整合進行大規模實驗,同時匯出相容於 Inspect 的對話記錄。

隨著 AI 系統日益強大並部署於複雜環境中,研究社群亟需像 Bloom 這樣具備高可擴展性的工具來探索模型的真實行為特質。


來源:Anthropic Eng+Research

閱讀原文 ↗
← 回首頁