Colibrì 引擎:純 C 語言實現 744B GLM-5.2 大模型於消費級電腦的突破性運行
分享 GLM 5.2 在本地低資源環境下執行的經驗,並進行優化,提供給希望在有限硬體上運行 LLM 的開發者實用參考。
• Colibrì 專案展示了一款突破性的純 C 語言引擎,使 744B 參數的 GLM-5.2 Mixture-of-Experts (MoE) 大型語言模型 能夠在配備約 25 GB RAM 的消費級電腦上運行。 • 此引擎的核心創新在於其獨特的 磁碟串流技術,僅將模型中約 9.9 GB 的密集部分常駐於記憶體,而將 ~370 GB 的 路由專家模組 儲存於磁碟,並按需串流讀取。 • 該引擎以 純 C 語言 編寫,無任何依賴項,不需 GPU 或 Python 運行環境,並採用 int4 量化 以提高效率。 • 它整合了 MLA 注意力機制、DeepSeek-V3 風格路由器 及 原生多令牌預測 (MTP) 推測解碼 等先進優化,以增強效能與響應延遲。 • 儘管並非追求極致速度,Colibrì 旨在低成本硬體上提供正確的輸出,並具備 學習快取 功能,能自動固定熱門專家模組,讓引擎隨著使用頻率增加而變得更快。 • GLM-5.2 的高度普及性引發了廣泛關注,因為任何人都能下載並在幾乎任何硬體上運行它,無需第三方中介。 • 外部報導指出,GLM-5.2 具有雙重用途潛力:雖然擅長識別軟體漏洞,但也可能被駭客利用,從而大幅增加 網路安全風險。
來源:Hacker News
閱讀原文 ↗另見:r/LocalLLaMA