单张 GH200 跑出 3323 tok/s:Muse Glimmer 30B 开放 API 实测

MaziyarPanahi · x · 2026-08-12

开发者在单张 NVIDIA GH200 显卡上,使用 DFlash 技术部署了 Muse Glimmer 30B 模型,实现了高达 3,323 tokens/s 的惊人推理速度。目前作者已将该模型的 API 免费开放给公众测试,邀请社区发送高难度问题来寻找模型的能力边界。此外,作者预告明天将继续进行 Qwen3.8 27B 模型的同类测试。

所属事件:单张GH200跑出3323 tok/s极限推理(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →