英伟达 Groq 3 LPX 全面量产,推理速度达 3400 token/秒

zephyr_z9 · x · 2026-08-24

英伟达宣布低延迟推理加速器 Groq 3 LPX 进入全面量产,该芯片设计用于扩展 Vera Rubin NVL72 系统。

据 Artificial Analysis 测试,Groq 3 LPX 运行 Gemma 4 31B、100K token 上下文时达到 3400 output tokens/秒,英伟达称其面向延迟敏感的 agent 工作负载,响应速度比最接近的竞品快 4 倍。

架构上将推理任务拆分:Rubin GPU 负责大规模上下文处理,LPX 负责快速 token 生成,目标场景为编码 agent、多步推理与工具调用。Nebius 将成为首个部署 Groq 3 LPX 的 AI 云(通过 Nebius Token Factory)。

所属事件:英伟达 Groq 3 LPX 全面量产,推理速度达 3400 token/秒(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →