NVIDIA Groq 3 LPX 实测:长上下文输出 3431 tokens/秒

scaling01 · x · 2026-09-01

NVIDIA 技术博客介绍 Groq 3 LPX——面向 Vera Rubin 平台的交互式 AI 推理加速器。第三方 Artificial Analysis 在 100K 上下文下测试 Gemma 4 31B,测得中位输出速度 3,431 tokens/秒;在 SPEED-Bench 编码基准上中位达 4,767 tokens/秒,P80 为 5,520 tokens/秒。

其核心是确定性执行模型:由编译器调度芯片间通信,并实现细粒度计算-通信重叠。Groq 3 LPX 可与 Vera Rubin NVL72 组合成 prefill-decode 分离、attention-FFN 分离、外部 drafter 投机解码等架构。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →