NVIDIA Groq 3 LPX 实测:Gemma 4 跑出 3431 tok/s

ricklamers · x · 2026-08-25

NVIDIA 发布技术博客,详细介绍 Groq 3 LPX 加速器在 Vera Rubin 平台上的性能表现。在与 Gemma 4 31B 模型的测试中,该系统在 100K 上下文窗口下实现了中位数 3,431 tokens/秒 的输出速度,在高算力负载场景下最高达到 10,996 tokens/秒。架构上,系统利用确定性编译器调度、细粒度计算通信重叠及预规划片间网络,最小化了首比特延迟。此外,Groq 3 LPX 支持多种协同执行配置(如预填充-解码分离、推测性外部草稿解码),旨在为万亿参数模型提供最佳能效比与交互速度。

所属事件:NVIDIA 展示 LPX 推理优化:Gemma 4 速度破万(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →