vLLM 宣布首發支援 NVIDIA Nemotron 3.5 Lightning:專為智慧代理打造的高效開源模型
vLLM 實現對 NVIDIA Nemotron 3.5 Lightning 的完整支援,提供 API 與推論優化方案
• vLLM 官方宣布推出針對 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支援,為開發者提供與 OpenAI 相容的 API 介面以串接各大應用與企業自動化系統。 • 該模型採用 300 億總參數、每次啟用 30 億參數的混合式混合專家模型(MoE)架構,並支援高達 100 萬 Token 的上下文長度,專為全天候運作的 **AI 代理(Agents)設計。 • 透過 MTP、DFlash 與 DSpark 等三種推測解碼(Speculative Decoding)**技術,其吞吐量較同級開源模型高出高達 4 倍,並能大幅縮短任務完成時間。 • 針對複雜的多輪對話、工具呼叫、程式碼編寫與指令遵循能力進行優化,適合應用於金融自動化、網路安全調查與電信營運等垂直領域。 • vLLM 此次更新進一步整合了 DSpark 異構推測器、W4A16 量化草稿頭與 Hopper 架構優化,實現更低的延遲與記憶體佔用。
「Nemotron 3.5 Lightning 的混合 MoE 架構與多 token 預測能力結合,能有效解決大型語言模型在執行頻繁且輕量代理步驟時的效能瓶頸。」 • 模型同時提供 BF16 與 NVFP4 部署選項,全面支援從 NVIDIA DGX Spark、H100 到 Jetson 等多樣化硬體平台。
來源:vLLM Blog
閱讀原文 ↗另見:Kilo Code Blog、NVIDIA Developer、Baseten