单张 GH200 跑出近万 tokens/s:Maple 20B 模型开放免费推理实测

MaziyarPanahi · x · 2026-08-06

开发者在单张 NVIDIA GH200 上对 DeepGroove AI 的新模型 Maple 20B-A1M 进行了并发推理实测,在 64 个并发请求下获得了 9,885 tokens/s 的吞吐量。

为验证该模型在端侧任务上的表现,作者公开了临时的免费 API 端点(限时 12 小时开放),鼓励社区进行压力测试并基于此构建应用。

所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →