单张 GH200 跑出近万 token/s,Maple 20B 模型实测惊艳
MaziyarPanahi · x · 2026-08-06
开发者 MaziyarPanahi 实测了 DeepGrooveai 推出的开源模型 Maple 20B-A1B。
- 硬件与性能:在单张 NVIDIA GH200 上,以 64 个并发请求进行推理,吞吐量高达 9,885 tokens/s。
- 开放测试:作者曾短暂开放了该模型的免费推理端点供社区压测和体验,验证了其在高并发流式响应下的稳定性。
所属事件:Maple 20B开源模型实测:单卡GH200吞吐近万(5 条相关)→
「Infra」频道最新
- 呼吁 AI 算力去中心化:从云端回归 5000 美元的本地个性化 AGI — Dan_Jeffries1 · 2026-08-06
- 8美元ESP32跑大模型:28.9M参数实现10 tokens/秒 — FinanceYF5 · 2026-08-06
- 12GB 显存跑 Minimax 视频生成:22分钟出片实测 — Svan_Derh · 2026-08-06
- 谢尔盖·布林揭秘:Jeff Dean 因 3 分钟语音用量力推谷歌自研 TPU — rohanpaul_ai · 2026-08-06
- 缺 DRAM 惹祸:台积电 10 亿美元苹果芯片被迫压库 — zephyr_z9 · 2026-08-06
- 深度实测本地 LLM 推理:GPU 显存与性能认知被颠覆 — Abhishekcur · 2026-08-06