单张 GH200 跑出 3323 tok/s,开发者开放 Muse Glimmer 30B API
MaziyarPanahi · x · 2026-08-12
开发者 mkurman88 在单张 NVIDIA GH200 显卡上部署了 Muse Glimmer 30B 模型,并使用 vLLM 框架跑出了惊人的 3,323 tokens/s 推理速度。
更有趣的是,他已将该 API 完全开放供公众测试,邀请社区发送高难度的 Prompt 来寻找模型的崩溃点。
所属事件:单卡 GH200 跑出 3323 tok/s 极限推理成绩(2 条相关)→
「Infra」频道最新
- 英伟达发布开源30B模型Nemotron,主攻智能体推理 — DeryaTR_ · 2026-08-12
- 马斯克:AI推理将走向太空,SpaceX目标10GW算力 — tetsuoai · 2026-08-12
- 华尔街分析师未追问 CoreWeave 与英伟达 500 亿合作 — firstadopter · 2026-08-12
- FlashRT 系统:用 AI Agent 自动优化部署,延迟降 70 倍 — BeidiChen · 2026-08-12
- Google 宣布建设三条新美洲海底光缆 — rseroter · 2026-08-12
- DeepSeek V4 量化实测:修复转换隐患与 8×RTX 5090 跑分 — gladkos · 2026-08-12