MiMo v2.5 本地推論表現驚豔:速度勝過雲端,填補中階模型鴻溝
高度評價 MiMo v2.5 模型,認為其在 30b-400b 之間填補了效能空白,甚至比雲端服務更快,並附帶了硬體配置和測試結果,是對特定模型在本地部署性能的深度實戰評估。
• 這篇文章強調 MiMo v2.5 是一個被嚴重低估的模型,在本地推論伺服器上的表現驚人,其速度甚至超越了快速的雲端供應商,有效填補了 30B 至 400B 參數區間的高效能模型空白。
• 作者利用 192GB 4090 VRAM 進行測試,發現 Bartowski IQ4_NL 在測試的模型中兼具最佳品質與速度,而 MiMo v2.5 則被譽為唯一值得為其構建大型伺服器的本地模型。
• 重複迴圈是 MiMo v2.5 面臨的一個明顯問題。為了解決此問題,作者分享了一套有效的參數設定:--temp 1.0、--top-p 0.95、--repeat-penalty 1.2、--repeat-last-n 128,並警告過於激進的懲罰設定可能導致模型「發瘋」。
• 在優化方面,MTP 和 --split-mode tensor 在 llama.cpp 中仍有開放的 GitHub 問題,而 --split-mode graph 雖在 ik_llama 中可用,但搭配的模型不盡理想。
• MiMo v2.5 還具備多模態潛力,特別是其內建的 ASR(自動語音辨識) 功能,儘管目前在 llama.cpp 中尚未運作,但作者認為若能實現,將能理解語氣、語調及背景噪音,對現有 Qwen3 ASR 而言將是巨大升級。
• > 作者總結:「這是我見過唯一值得為其構建大型伺服器的本地模型。」
來源:r/LocalLLaMA
閱讀原文 ↗