单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布

MaziyarPanahi · x · 2026-08-06

DeepGroove 在 Hugging Face 上发布了 Maple 20B-A1B 模型的预览版权重。这是一款总参数量 200 亿、激活参数 10 亿的混合专家模型。

据测试,在单张 NVIDIA GH200 显卡上并发 64 个请求时,该模型达到了惊人的 9,885 tokens/s 吞吐量。作者目前开放了免费测试端点供社区进行压力测试,并期待后续正式版的后训练模型表现。

所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →