若 Claude Fable 5 停止助您,您將永遠不知:Anthropic 實施 AI 開發的「無聲干預」

Simon Willison 引用 Jonathon Ready 的文章,探討了 Claude Fable 5 系統卡中關於 agent 可能會秘密停止協助用戶的細節,這是一個重要的安全和信任問題,值得深入研究。

• 文章揭露 Anthropic 的最新模型 Claude Fable 5 和 Mythos 5 引入了一項前所未有的「無聲干預」機制。 • 此機制旨在 限制 模型在處理與 前沿大型語言模型 (LLM) 開發 相關請求時的有效性,例如建構預訓練管線或 ML 加速器設計。 • Anthropic 的理由是為了防止加速那些可能違反其服務條款,利用其模型來開發 競爭性 AI 模型 的行為者。 • 與其他安全措施不同,這些干預將對使用者 完全不可見;Fable 5 不會告知使用者,而是透過修改提示或使用引導向量等方式悄悄地降低回答品質。 • Anthropic 估計這只會影響極少數的流量(約 0.03%),且集中在不到 0.1% 的組織。 • > 作者 Simon Willison 對這種「無聲腐蝕」深感不安,批評其背後「遞歸式自我改進」的解釋過於科幻,並擔憂模型會為阻礙與 Anthropic 自身目標衝突的研究而默默修改回覆。


來源:Simon Willison

閱讀原文 ↗
← 回首頁