单张 GH200 跑出 9885 tokens/s,Maple 20B 实测刷新推理速度
MaziyarPanahi · x · 2026-08-06
开发者 @MaziyarPanahi 实测了 @deepgroveai 推出的开源模型 Maple 20B-A1B。在单张 NVIDIA GH200 处理器上,配合 64 个并发请求,该模型创下了 9,885 tokens/s 的惊人推理速度。
作者随后开放了该模型的免费测试端点(限时 12 小时),邀请社区共同进行压力测试。该模型也被寄予厚望,有望成为能在手机端运行的医疗 AI 应用。
所属事件:Maple 20B 开源 MoE 模型发布,单卡 GH200 推理速度破纪录(2 条相关)→
「Infra」频道最新
- 企业部署AI的灵魂拷问:你的AI到底跑在哪里? — DavidLinthicum · 2026-08-06
- AI 推理需求年增十倍,算力短缺将成常态 — TansuYegen · 2026-08-06
- 企业数据无法迁移,AI 战略沦为纸上谈兵 — DavidLinthicum · 2026-08-06
- Mac本地跑大模型:Nativ支持LiquidAI LFM2.5,8.5GB内存跑满128K上下文 — JosephJacks_ · 2026-08-06
- 初创公司 Panthalassa 研发波浪能漂浮 AI 数据中心 — TinfoilTricorn · 2026-08-06
- 单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点 — MaziyarPanahi · 2026-08-06