SGLang 首发支持 Meta 新模型 Muse Glimmer,单卡吞吐量达 230 tok/s

NVIDIAAI · x · 2026-08-10

SGLang 宣布为 Meta 最新发布的 Muse Glimmer 多模态模型提供 Day-0 支持。

在开启 NVFP4 和 DFlash 优化的情况下,该模型在单张 RTX 5090 显卡上的推理速度可达约 230 tokens/秒。此外,该模型也支持开箱即用运行于 NVIDIA RTX PRO 6000、DGX Spark 以及通过 MLX 框架运行于 Apple Silicon 平台。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →