单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点
MaziyarPanahi · x · 2026-08-06
开发者 Maziyar Panahi 宣布向社区免费开放 Maple 20B-A1B 模型的推理 API 端点,限时 12 小时供大众测试和压测。
该模型部署在单块 NVIDIA GH200 上,使用 vLLM 0.26.0 和 FP8 精度。在 64 个并发请求下,端点吞吐量达到了惊人的 9,885 tokens/s。用户可使用提供的地址和密钥,仅限合成或公开数据进行测试。
所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→
「Infra」频道最新
- 三星拟将 60-70% 产能签长约,亚马逊微软等成核心客户 — Beth_Kindig · 2026-08-06
- SanDisk高管表态:80%以上毛利率才是公平回报 — firstadopter · 2026-08-06
- 谷歌AI令牌处理量两年增330倍,推理需求激增 — Beth_Kindig · 2026-08-06
- 长上下文成倍放大推测解码收益,接受率逼近100% — DjCanalex · 2026-08-06
- 企业部署AI的灵魂拷问:你的AI到底跑在哪里? — DavidLinthicum · 2026-08-06
- AI 推理需求年增十倍,算力短缺将成常态 — TansuYegen · 2026-08-06