Muse Glimmer 模型本地运行实测:单卡 RTX 5090 达 230 tok/s

BanghuaZ · x · 2026-08-11

LMSYS 转发展示了 Meta 新开源的 Muse Glimmer(30B 稠密模型)在本地设备上的惊人推理速度。

借助 SGLang 框架以及 NVFP4 和 DFlash 优化技术,该模型在单张 RTX 5090 显卡上能达到约 230 tokens/秒的生成速度,并且可以在 RTX Pro 6000、DGX Spark 甚至 Mac (MLX) 上开箱即用。这种速度和可靠性的结合,使得构建极速、始终在线的本地智能体成为可能。

所属事件:单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →