Fable 5 遭禁重啟:政府介入後,你用的模型還是 Fable 嗎?

作者對 Fable 5 進行了基準測試,比較了新舊版本,並分享了實際使用中的觀察,有助於了解模型的實際表現。

Anthropic 的 Fable 5 模型在推出後,因安全漏洞遭美國政府下令下架,隨後於 7 月 1 日重新上線,並加入了重新訓練的 安全分類器。 • Kilo Code Blog 在禁令前後進行了 基準測試,深入探討政府干預如何改變用戶實際獲得所請求模型的頻率。 • 儘管測試顯示模型介入率從約 20% 微幅上升至 22%,但其影響方式發生了顯著變化。 • 現在,許多請求並非被拒絕,而是會 悄然切換Claude Opus 4.8 完成,用戶可能在不知情的情況下由不同模型提供服務,甚至整個會話都由 Opus 執行。 • 這種 靜默切換 會導致 第三方基準測試結果失真,並讓用戶對成本與延遲的預期建立在錯誤的模型基礎上。

作者強調,這是首例邊界模型遭政府下架並經協商後改變行為重返市場,確立了「你究竟與哪個模型對話」現在部分取決於實驗室與監管機構間政策問題的先例。 • 因此,用戶務必 明確追蹤每一步實際提供服務的模型,以確保評估準確性,並可考慮在特定任務上直接指定 Opus,避免不確定性。


來源:Kilo Code Blog

閱讀原文 ↗

另見:Simon Willison、Ben's Bites

← 回首頁