Maple 20B开源模型实测:单张GH200跑出9885 tokens/s
DeepGroove发布了预览版开源混合专家模型Maple 20B-A1B,总参数量200亿,激活参数10亿。开发者实测发现,该模型在单张NVIDIA GH200处理器上配合64个并发请求,推理吞吐量高达9885 tokens/s。目前官方已向社区限时开放了免费的推理API端点供大众压测。
2026-08-06 ~ 2026-08-06 · 4 条相关
- 第 1 集:DeepGrove发布开源模型Maple,Mac Mini跑出超200 tokens/s(2026-08-05,4 条)
- 第 2 集:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(2026-08-06,4 条)
- 单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度 — MaziyarPanahi · 2026-08-06
- 单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点 — MaziyarPanahi · 2026-08-06
- 单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布 — MaziyarPanahi · 2026-08-06
另有 1 条近重复转述:MaziyarPanahi