SGLang 首发支持 Meta 新模型 Muse Glimmer,单卡吞吐量达 230 tok/s
NVIDIAAI · x · 2026-08-10
SGLang 宣布为 Meta 最新发布的 Muse Glimmer 多模态模型提供 Day-0 支持。
在开启 NVFP4 和 DFlash 优化的情况下,该模型在单张 RTX 5090 显卡上的推理速度可达约 230 tokens/秒。此外,该模型也支持开箱即用运行于 NVIDIA RTX PRO 6000、DGX Spark 以及通过 MLX 框架运行于 Apple Silicon 平台。
「Infra」频道最新
- 英特尔拟发行150亿美元股票,全力加码AI算力 — Polymarket · 2026-08-10
- 告别摘要压缩:densely 实现无损 LLM 上下文压缩,最高省 87% Token — No_Advertising2536 · 2026-08-10
- 2-bit量化版Muse Glimmer在14GB内存实现百次工具调用 — danielhanchen · 2026-08-10
- 单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能 — coder543 · 2026-08-10
- 黑石总裁将出席峰会,谈AI投资与数据中心布局 — GavinSBaker · 2026-08-10
- 营收增108%但增速放缓,寒武纪面临供应与竞争压力 — pstAsiatech · 2026-08-10