Simon Willison 推出 smevals:輕量級的 AI 模型與提示詞評測工具
介紹專為評估模型、Prompt 與 Harness 而設計的小型評測工具 smevals,高度契合 Harness Engineering 實戰。
• smevals 是由知名開發者 Simon Willison 與 Prime Radiant 實驗室合作開發的全新輕量級評測套件,專門用於評估不同 AI 模型、提示詞與執行框架的效能。
• 該工具設計專為協同AI 編碼代理運作,開發者只需透過指令即可讓代理自動學習並建立專屬的評測套件。
• 核心架構採用 YAML 檔案定義評估任務(Challenges 與 Tasks),並將「執行(Runs)」與「評分(Grading)」流程嚴格分離。
• 評分系統支援從簡單的字串檢查、XML 驗證到複雜的自定義檢查器(Checkers)與模型交叉評估。
• 使用者可以透過內建的 serve 指令啟動本地網頁伺服器探索結果,或使用 build 指令產生靜態 HTML 報告進行部署。
「smevals 是我多年來尋找理想評測方法的第三次迭代,這個版本終於讓我覺得對了。」 • 整個工具的核心詞彙包含評估、任務、配置、執行與評分,旨在清晰回答特定 AI 模型的實際能力表現。
來源:Simon Willison
閱讀原文 ↗