Anthropic 推出 Claude Fable 5.1:從科學跑分到高階推理的「鵜鶘騎單車」實測

Simon Willison 深度評測 Claude Fable 5.1 在科學研究與程式碼任務上的表現與基準測試。

• Anthropic 正式發表全新 Claude Fable 5.1 模型,主打強化的程式碼編寫、知識工作與科學研究能力,並已在 GitHub Copilot 等平台全面上線。 • 新模型在全新推出的 Terminal-Bench-Science 0.1 科學基準測試中創下 52.6% 的亮眼表現,展現卓越的長文本與自主推理實力。 • 知名開發者 Simon Willison 透過其獨特的 「鵜鶘基準測試」(要求模型生成騎單車的鵜鶘 SVG),實測 Fable 5.1 在不同推理強度設定下的表現差異。 • 測試發現,當推理強度設為低或中時,模型幾乎會略過思考過程;但在 xhigh 與 max 的最高強度下,模型展現出極為細緻的 SVG 佈局與視覺構思能力。 • 作者指出:

「在將推理強度拉到最高後,這是我見過 Anthropic 模型生成過最棒的鵜鶘 SVG,細節與構圖令人驚艷。」 • 透過進一步的指令串接,開發者甚至成功將靜態的 SVG 鵜鶘升級為具備動畫效果的版本,展現 AI 在複雜視覺任務上的進階潛力。


來源:Simon Willison

閱讀原文 ↗

另見:GitHub Copilot Changelog、Kilo Code Blog、Hacker News

← 回首頁