单张 GH200 跑出近万 tokens/s:Maple 20B 模型开放免费推理实测
MaziyarPanahi · x · 2026-08-06
开发者在单张 NVIDIA GH200 上对 DeepGroove AI 的新模型 Maple 20B-A1M 进行了并发推理实测,在 64 个并发请求下获得了 9,885 tokens/s 的吞吐量。
为验证该模型在端侧任务上的表现,作者公开了临时的免费 API 端点(限时 12 小时开放),鼓励社区进行压力测试并基于此构建应用。
所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→
「Infra」频道最新
- Marvell 光互连技术获 AI 基础设施奖,突破内存瓶颈 — BenBajarin · 2026-08-06
- Aeva 进军 AI 数据中心光互连,已与超大厂达成合作 — BenBajarin · 2026-08-06
- 算力扩张与Token极致效率相悖,AI基建逻辑遭质疑 — StewartalsopIII · 2026-08-06
- 开发者呼吁为本地 LLM 增加三级 MoE 硬盘卸载功能 — storm1er · 2026-08-06
- 算力上太空?SpaceX 星载 GPU 租赁经济账推演 — teortaxesTex · 2026-08-06
- Chamath 警告:AI 算力成本 45 天翻倍,生产力仅提升 5% — rohanpaul_ai · 2026-08-06