单张 GH200 跑出 3323 tok/s,开发者开放 Muse Glimmer 30B API

MaziyarPanahi · x · 2026-08-12

开发者 mkurman88 在单张 NVIDIA GH200 显卡上部署了 Muse Glimmer 30B 模型,并使用 vLLM 框架跑出了惊人的 3,323 tokens/s 推理速度。

更有趣的是,他已将该 API 完全开放供公众测试,邀请社区发送高难度的 Prompt 来寻找模型的崩溃点。

所属事件:单卡 GH200 跑出 3323 tok/s 极限推理成绩(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →