Meta 開源 30B 模型 Muse Glimmer 實際測試:單張 RTX 3090 輕鬆跑滿 256k 長上下文
開發者分享在單張 RTX 3090 上完整運行 Muse Glimmer 的指令參數與硬體優化實測,具極高實作參考價值。
• Meta 近期重返開源權重領域,推出採用 Apache 2.0 授權 的全新 30B 模型 Muse Glimmer,擺脫以往 Llama 複雜授權的限制。 • 實測顯示,Muse Glimmer 使用 Q4_K_XL 量化 版本,搭配完整上下文、DFlash 與 mmproj,能舒適地在單張 RTX 3090(佔用約 22GB 至 23GB VRAM)上運行。 • 與同級的 Qwen3.6-27B 和 Gemma-4-31B 相比,Muse Glimmer 在 RTX 3090 上展現出更優異的 VRAM 效率,無需妥協於較小的 KV 快取或依賴備用伺服器。 • 效能表現相當出色,在 DFlash 加速下輸出速度可達 64 至 124 tok/s,提示詞處理速度更是高達約 1400 tok/s。 • 經過 150k 權重的雙針大海撈針(needle-in-a-haystack)測試,模型一次就完美检索成功,證實其完整支援 256k 上下文。
在代理任務與工具呼叫方面,Muse Glimmer 在 DeepSearch QA、MCP-Atlas 與 SWE-Bench 等基準測試中表現優異,能實現端到端的長序列多步驟推理。
來源:r/LocalLLaMA
閱讀原文 ↗另見:r/LocalLLaMA、Hugging Face、Simon Willison