Mac Mini 跑出 200+ tokens/s,DeepGrove 发布端侧推理新模型

ycombinator · x · 2026-08-05

DeepGrove 发布了开源的 Maple-Preview 模型,这是一个 20B 参数(激活 1B)的三值权重推理大语言模型。

据称该模型在其权重类别中达到了 SOTA 水平,能够解决 IMO(国际数学奥林匹克)级别的问题。最引人注目的是,它可以在 Mac Mini M4 上以每秒 200+ tokens 的速度运行,比 Gemma 4、Qwen3.5 等同级别高效模型快 5 到 16 倍,向设备上的个人智能体迈出了重要一步。

所属事件:DeepGrove发布Maple模型,Mac Mini端侧推理破200 tokens/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →