新基准AA-AgentPerf:GB300每兆瓦并发智能体数为H200约20倍
新智元 · wechat · 2026-07-04
独立评测机构ArtificialAnalysis发布业内首个专为AI智能体设计的推理基准AA-AgentPerf,主指标为“每兆瓦并发智能体数”。它不喂定长合成请求,而是回放真实编程智能体轨迹,覆盖12+种语言、最长约200轮、上下文可达13万token,并放开KV cache复用、推测解码等生产优化,先锁死SLO服务标准再测最大并发。
英伟达公布的AA-AgentPerf成绩显示:在每秒20与60 token两档服务标准下,GB300NVL72每兆瓦的并发智能体数均约为H200的20倍——同样一兆瓦电,GB300NVL72可同时扛约61400个智能体,H200仅约2600个。
文章指出,智能体负载是接力式长链调用,单次请求基准已量不动这种链式调用、工具等待与上下文膨胀;对真金白银买卡建数据中心者,真正关心的是每度电每块GPU能养活多少干活的智能体。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11