開源 MCP 伺服器 gwen-digestor:免 GPU 將 LLM 上下文 Token 壓縮達 38%
作者開發了 gwen-digestor,一個 MCP server,能在 CPU 上透過壓縮對話內容來減少 LLM 的 Token 使用量,並提供具體的壓縮效果數據,是 CPU 黨必看的高價值實戰技巧。
作者因在僅有 CPU 的硬體上運行本地大型語言模型 (LLM),持續面臨 上下文管理 及 Token 限制 的挑戰。 他開發了 gwen-digestor,這是一個開源的 MCP 伺服器,能在對話進入上下文窗口前進行壓縮。 • 該工具取得了顯著成效,整體 Token 減少 38.3%,輸出回應的 Token 甚至減少了約 72%。 • gwen-digestor 的運作無需 GPU、嵌入或外部 API 調用,僅依賴於確定的 正規表達式 及 結構化壓縮。 • 它能根據訊息類型(如簽到、任務、JSON 或程式碼)進行 模式感知壓縮,例如從程式碼中移除註解或對 JSON 進行智能壓縮。 • 此外,它內建 gzip 壓縮的參考快取,避免重複處理相同文本,並具備 持久性統計追蹤 功能以測量實際節省量。
作者指出其設計旨在解決 CPU 環境下 LLM 上下文限制的痛點,並已將完整的程式碼及報告開源於 GitHub 供大眾使用。
來源:r/LLMDevs
閱讀原文 ↗