单张 GH200 跑出近万吞吐量,Maple 20B 开放免费推理端点

MaziyarPanahi · x · 2026-08-06

开发者 Maziyar Panahi 宣布向社区免费开放 Maple 20B-A1B 模型的推理 API 端点,限时 12 小时供大众测试和压测。

该模型部署在单块 NVIDIA GH200 上,使用 vLLM 0.26.0 和 FP8 精度。在 64 个并发请求下,端点吞吐量达到了惊人的 9,885 tokens/s。用户可使用提供的地址和密钥,仅限合成或公开数据进行测试。

所属事件:Maple 20B开源模型实测:单张GH200跑出9885 tokens/s(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →