单张 GH200 跑出 3323 tok/s:Muse Glimmer 30B 开放 API 实测
MaziyarPanahi · x · 2026-08-12
开发者在单张 NVIDIA GH200 显卡上,使用 DFlash 技术部署了 Muse Glimmer 30B 模型,实现了高达 3,323 tokens/s 的惊人推理速度。目前作者已将该模型的 API 免费开放给公众测试,邀请社区发送高难度问题来寻找模型的能力边界。此外,作者预告明天将继续进行 Qwen3.8 27B 模型的同类测试。
所属事件:单张GH200跑出3323 tok/s极限推理(3 条相关)→
「Infra」频道最新
- 推理非投机:Token 消费不同于泡沫期硬件囤积 — AccBalanced · 2026-08-26
- 高通 Oryon CPU 跑 5GHz,FlexCache 助力 Agent — davemccollough · 2026-08-26
- 买本地跑模型的机器前,先问 AI 你的具体需求 — cocktailpeanut · 2026-08-26
- 配置变更导致 17% 进程崩溃,重试浪涌引发连锁事故 — techNmak · 2026-08-26
- 遥测服务致 K8s 控制平面过载,OpenAI 全线宕机复盘 — techNmak · 2026-08-26
- 17%会话进程瞬间掉线引发级联故障,Discord宕机复盘 — techNmak · 2026-08-26