開放模型 Kimi K3 實力媲美 Fable,結合路由締造最高品質與成本效益 AI

比較 Kimi K3 和 Fable 5 在代理任務上的表現,並提出混合使用 K3 和 Fable 的 SoTA 方案,對開發者進行模型選擇和成本優化有實際指導意義。

• Fireworks AI 的研究指出,開放模型 Kimi K3 在性能上與閉源模型 Fable 5 旗鼓相當,且成本效益顯著更高。 • 在約 1,000 項代理任務中,K3 和 Fable 5 在多數基準測試上表現相近,例如軟體工程 (SWE) 任務準確率皆約 92.4-92.6%。 • 然而,兩者各有專精:Kimi K3 在符號數學、開發工具與長期終端任務表現出色;而 Fable 5 則擅長網路、資料視覺化及多語言編碼。 • 透過 任務路由 策略性地結合 K3 與 Fable,能實現高達 93% 的準確率,超越單一模型,達到業界最先進 (SoTA) 水準。 • 這種路由方案在長期代理迴圈中,相較單獨使用 Fable 可節省高達 50 倍成本,且普遍更具成本效益,主要歸因於 K3 的低廉代幣定價與提示快取機制。 • 研究顯示,預測路由可讓 K3 處理 72-96% 的任務,建議將開放模型作為預設選項。 • > 作者指出:「單一模型提供者、追求代幣最大化的時代即將結束。最佳的 AI 不再來自單一實驗室,而是多個模型的組合。」


來源:Fireworks AI

閱讀原文 ↗

另見:Hacker News

← 回首頁