单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度

MaziyarPanahi · x · 2026-08-06

开发者 @MaziyarPanahi 实测了 @deepgroveai 推出的开源模型 Maple 20B-A1B。在单张 NVIDIA GH200 处理器上,配合 64 个并发请求,该模型创下了 9,885 tokens/s 的惊人推理速度。

作者随后开放了该模型的免费测试端点(限时 12 小时),邀请社区共同进行压力测试。该模型也被寄予厚望,有望成为能在手机端运行的医疗 AI 应用。

所属事件:Maple 20B 开源 MoE 模型发布,单卡 GH200 推理速度破纪录(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →