更好的模型,更糟的工具:Anthropic 新型 AI 在客製化工具呼叫的挑戰
Simon Willison 轉載了 Armin Ronacher 的文章,指出新版 Claude 模型(Opus 4.8)有時會向 Pi 的 edit tool 傳遞額外、虛構的欄位,導致工具呼叫失敗。這篇是關於模型行為的實際觀察與踩坑,對理解模型局限性有幫助。
• Anthropic 旗下最新的 SOTA 模型(如 Opus 4.8 和 Sonnet 5)被發現在呼叫第三方 Pi 的客製化編輯工具時,表現竟比舊模型更差。
• 這些新模型在工具呼叫的 edits[] 陣列中憑空創造額外欄位,導致參數不符合預期資料結構而遭到拒絕,儘管編輯內容本身通常是正確的。
• Armin 理論推測,此問題源於 Anthropic 新模型可能透過強化學習,針對 Claude Code 內建的編輯工具進行了專門訓練。
• 這種訓練的副作用是,其他如 Pi 等使用不同工具架構的第三方程式編輯工具,其功能反而更容易被錯誤呼叫。
• 該文也提及,Claude 的編輯工具採用搜尋與取代機制,而 OpenAI 的 Codex 則使用 apply_patch。
• > 這篇文章暗示,AI 模型針對特定工具的訓練可能導致其在其他工具上的泛化能力下降。
• 因此,第三方工具開發者面臨挑戰:是否需針對不同的 AI 模型實作多種編輯工具,以確保最佳的工具呼叫效能?
來源:Simon Willison
閱讀原文 ↗另見:Armin Ronacher