開源新星 Kimi K3 對決 Claude Fable 5:性價比與程式碼能力深度解析

Together AI 針對 Kimi K3 與 Claude Fable 5 的 DeepSWE 評測與性價比分析,具備具體數據

• 月之暗面(Moonshot AI)推出的開源模型 Kimi K3 在 DeepSWE 基準測試中展現驚人實力,效能直逼 Anthropic 的旗艦模型 Claude Fable 5。 • 在單次嘗試的 pass@1 表現上,Fable 5 以 69.9% 微幅領先 Kimi K3 的 68.5%;但若給予多次機會,Kimi K3 的 pass@2pass@4 分別達到 82.0% 與 89.4%,反超對手。 • 成本方面 Kimi K3 具備壓倒性優勢,每次 rollout 僅需 $4.65(Fable 5 則需 $13.41),換算下來每美元可達成 2.8 倍的解題量。 • 兩者在程式語言表現各有擅長,Fable 5 在 Python、JavaScript、TypeScript 與 Rust 佔優,而 Kimi K3 則在 Go 語言表現亮眼,且 Rust 實力直逼頂尖模型。 • 除了程式碼能力,Kimi K3 亦在 Arena.ai 的前端代碼排行榜上登頂,引發美國 AI 業界高度關注與熱議。

Kimi K3 堪稱目前最具性價比的理性選擇,在提供近乎旗艦級表現的同時,價格僅需對手的三分之一,且開源特性賦予團隊完全的部署掌控權。


來源:Together AI Blog

閱讀原文 ↗

另見:Kilo Code Blog、TechCrunch AI、TechCrunch AI

← 回首頁