Google DiffusionGemma 開源釋出:擴散語言模型重磅回歸,引領高速 AI 新紀元
Simon Willison 介紹 DiffusionGemma,這是 Gemma 模型家族中的新成員,強調其 4x 文本生成速度的提升,對研究者和開發者有價值。
Google 曾於去年釋出實驗性 Gemini Diffusion 模型,現以 DiffusionGemma 之名重新回歸,並採 Apache 2 開源授權。
這款由 Google 推出的 google/diffusiongemma-26B-A4B-it 模型,是繼最初實驗版本後,以 開源權重 形式釋出的最新 擴散語言模型 (dLLM)。
• NVIDIA 現已透過其 NIM 雲端 API 免費託管此模型,展示出卓越的生成速度,例如生成圖像耗時 4.4 秒,產生超過 2,400 個 token,速率至少達 每秒 500 個 token。
• DiffusionGemma 亦是 vLLM 首個支援的 擴散語言模型,透過 Model Runner v2 的抽象化與 vLLM 的推測解碼 技術,展現其靈活性與未來對 dLLLM 的支援潛力。
此模型在 逐 token 生成速度 上有顯著提升,對於開發即時 AI 應用(如聊天助理、Copilot 和代理工作流程)的開發者而言,有效解決了常見的效能瓶頸。
文章作者 Simon Willison 曾對其初期預覽版留下深刻印象,記錄到每秒 857 個 token 的速度,並稱其為「令人興奮的模型」。
來源:Simon Willison
閱讀原文 ↗另見:Google DeepMind、vLLM Blog、NVIDIA Developer