我開發了 smokebench:用於快速評測大語言模型的輕量級 TUI 工具

開源 TUI 基準測試工具的開發分享,滿足量化與比較本地端模型效能的實戰需求。

• 由於公共排行榜無法真實反映量化或微調後模型的效能,開發者打造了 smokebench 這款開源工具。 • 這是一個專為快速評測而設計的 TUI(終端使用者介面),支援所有相容 OpenAI 或 Anthropic 格式的 API 端點。 • 內建涵蓋數學、程式碼、創意寫作與長上下文等 8 種不同類型的評測類別。 • 具備 LLM-as-judge 評分機制、TTFT/TPS 效能指標,並支援匯出 Markdown 與 JSON 格式日誌。 • 可以直接與 Ollama、LM Studio、vLLM 等本地或遠端服務無縫整合,安裝過程極其簡單。

作者表示:「我想要一個能測試本地設定、捕捉模型間效能退化,並比較不同端點 TPS 的工具,且不需要寫一堆繁瑣的腳本。」 • 目前該專案正處於積極開發階段,未來將持續優化使用者介面並增加更多內建基準測試。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁