Maple 20B-A1B 预览版发布,单卡 GH200 跑出 9885 tokens/s
DeepGroove AI 在 Hugging Face 上发布了开源混合专家模型 Maple 20B-A1B 的预览版权重。该模型在并发推理中展现出极高的吞吐量,为高并发开源推理方案提供了新的参考。
已确认
- 模型参数:Maple 20B-A1B 是一款混合专家模型,总参数量为 200 亿,激活参数量为 10 亿。
- 推理性能:据开发者 MaziyarPanahi 实测,该模型部署在单张 NVIDIA GH200 处理器上,在 64 个并发请求的条件下,吞吐量达到了 9,885 tokens/s。
- 部署细节:实测使用了 vLLM 0.26.0 版本进行部署。
- 社区测试:MaziyarPanahi 宣布向社区免费开放该模型的推理 API 端点,限时 12 小时供大众进行测试和压测。
为什么重要
- 端侧与高并发潜力:极高的单卡吞吐量表明,通过 MoE 架构大幅降低激活参数,能够在顶级单卡硬件上实现非常可观的并发处理能力,为高吞吐推理服务提供了新的开源参考方案。
2026-08-06 ~ 2026-08-06 · 5 条相关
- 第 1 集:DeepGrove发布开源模型Maple,Mac Mini跑出超200 tokens/s(2026-08-05,4 条)
- 第 2 集:Maple 20B-A1B 预览版发布,单卡 GH200 跑出 9885 tokens/s(2026-08-06,5 条)
一手来源
- 单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度 — MaziyarPanahi ·
- 单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布 — MaziyarPanahi ·
- 单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点 — MaziyarPanahi ·
- 【源头】单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度 — MaziyarPanahi · 2026-08-06
- 【源头】单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点 — MaziyarPanahi · 2026-08-06
- 【源头】单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布 — MaziyarPanahi · 2026-08-06
- 单张 GH200 跑出近万 token/s,Maple 20B 模型实测惊艳 — MaziyarPanahi · 2026-08-06
另有 1 条近重复转述:MaziyarPanahi