從零打造 BitNet 純 C 語言推論引擎:在 Xeon CPU 上實現每秒 36 個 Token 的效能突破

獨立開發者用純 C99 從零打造 BitNet 推理引擎的深度實作、踩坑與 SIMD 優化心得

• 開發者使用純 C99 從頭打造專為 CPU 設計的零相依性推論引擎,完全不依賴 Python、CUDA 或 BLAS。 • 專為 1.58位元三元模型(BitNet b1.58-2B-4T)優化,在 Intel Xeon 處理器上使用 4 執行緒可達到每秒 36.25 個 Token 的速度。 • 採用原生三元 SIMD 技術,將四個權重打包裝入一個位元組,並利用 AVX2 與 AVX-512 指令集直接在整數暫存器中進行累積運算,避開浮點數解包開銷。 • 執行緒池使用 C11 原子操作 與自旋鎖(spin-then-yield),實現幾乎為零的執行緒同步開銷。 • 整個專案可編譯成單一獨立二進位檔,並直接提供 OpenAI 相容的 API 端點。

作者指出:「解碼速度主要受限於 DRAM 頻寬天花板,在批次大小為 1 時,記憶體頻寬已使用約 95%,因此單純優化計算核心無法顯著降低單一序列的 Token 延遲。」


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁