单卡 GH200 跑出 9885 tokens/s,Maple 20B 开源 MoE 模型预览发布
MaziyarPanahi · x · 2026-08-06
DeepGroove 在 Hugging Face 上发布了 Maple 20B-A1B 模型的预览版权重。这是一款总参数量 200 亿、激活参数 10 亿的混合专家模型。
据测试,在单张 NVIDIA GH200 显卡上并发 64 个请求时,该模型达到了惊人的 9,885 tokens/s 吞吐量。作者目前开放了免费测试端点供社区进行压力测试,并期待后续正式版的后训练模型表现。
所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→
「Infra」频道最新
- 三星拟将 60-70% 产能签长约,亚马逊微软等成核心客户 — Beth_Kindig · 2026-08-06
- SanDisk高管表态:80%以上毛利率才是公平回报 — firstadopter · 2026-08-06
- 谷歌AI令牌处理量两年增330倍,推理需求激增 — Beth_Kindig · 2026-08-06
- 长上下文成倍放大推测解码收益,接受率逼近100% — DjCanalex · 2026-08-06
- 企业部署AI的灵魂拷问:你的AI到底跑在哪里? — DavidLinthicum · 2026-08-06
- AI 推理需求年增十倍,算力短缺将成常态 — TansuYegen · 2026-08-06