Sourcegraph MCP 伺服器協同較便宜模型,在多儲存庫程式碼探索中完勝 Mythos 級頂尖模型
Sourcegraph MCP server 結合 Claude Sonnet 4.6 在 CodeScaleBench 任務上表現優於單獨的 Mythos 模型,且成本更低,提供了具體的工具與模型組合實戰評估。
• Sourcegraph 的一項基準測試顯示,配備 Sourcegraph MCP 伺服器 的 Claude Sonnet 4.6 模型,在九項針對大型多儲存庫程式碼庫的程式碼探索任務中,表現優於單獨運行的 Claude Fable 5 模型。 • Claude Fable 5 是 Anthropic Mythos 級的第一個普遍可用模型,曾創下多數公開基準測試的最新紀錄。 • 在這些任務中,結合 Sourcegraph MCP 伺服器 的 Claude Sonnet 4.6 取得了 0.698 的分數,而 Claude Fable 5 則獲得 0.568,且每點品質的成本幾乎高出兩倍。 • 較便宜的模型在九項任務中贏得了六項,其優勢主要體現在需要跨儲存庫探索的任務上,例如追蹤漏洞和跨組織依賴關係。 • Sonnet 4.6 搭配 Sourcegraph,透過搜尋、符號解析和引用追蹤等檢索能力來存取程式碼庫,而 Fable 5 則直接在本地讀取整個儲存庫。 • 成本效益更高的模型在分數和成本上都佔據優勢。 • > 作者指出:「對於任何預算有限的代理程式開發者來說,一個結合出色程式碼檢索能力的更便宜、更快速的模型,在跨儲存庫工作上能擊敗更昂貴的尖端模型。」 • 儘管這只是九項任務的初步信號,並非最終基準,但結果表明檢索能力對於處理複雜程式碼庫的代理程式至關重要。
來源:Sourcegraph
閱讀原文 ↗