专题 · FULL STORY
DeepGrove Maple模型:从发布到极速实测
DeepGrove发布开源三值权重混合专家模型Maple-Preview,总参数量达200亿。随后开发者进行极限实测,该模型在Mac Mini及单张GH200上分别跑出超200和9885 tokens/s的惊人速度。
2026-08-05 ~ 2026-08-06 · 2 集 · 8 条
第 1 集 · DeepGrove发布开源模型Maple,Mac Mini跑出超200 tokens/s(2026-08-05,4 条)
DeepGrove发布了名为Maple-Preview的开源三值权重推理大模型。该模型总参数量达200亿,激活参数约10亿,在同等权重类别中达到了SOTA水准,甚至能够解决IMO级别的数学难题。其核心突破在于极致的端侧运行效率,能够在Mac Mini等消费级硬件上实现每秒超200个token的生成速度,大幅降低了本地大模型推理的硬件门槛。
- 20B 模型 Mac Mini 跑出 200+ tokens/s,且可解决 IMO 级数学题 — tylerbruno05 · 2026-08-05
- Mac Mini 跑出 200+ tokens/s,DeepGrove 发布端侧推理新模型 — ycombinator · 2026-08-05
- Mac Mini 跑出 200+ tokens/s:Maple 开源三值权重模型 — garrytan · 2026-08-05
- Deepgrove 发布 20B 三值权重推理开源模型 Maple-Preview — cafedude · 2026-08-05
第 2 集 · Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(2026-08-06,4 条)
DeepGroove发布了预览版开源混合专家模型Maple 20B-A1B,总参数量200亿,激活参数10亿。开发者实测发现,该模型在单张NVIDIA GH200处理器上配合64个并发请求,推理吞吐量高达9885 tokens/s。目前官方已向社区限时开放了免费的推理API端点供大众压测。
- 单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度 — MaziyarPanahi · 2026-08-06
- 单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点 — MaziyarPanahi · 2026-08-06
- 单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布 — MaziyarPanahi · 2026-08-06
- 单张 GH200 跑出近万 tokens/s:Maple 20B 模型开放免费推理实测 — MaziyarPanahi · 2026-08-06