英伟达 Groq 3 LPX 全面量产,推理速度达 3400 token/秒
zephyr_z9 · x · 2026-08-24
英伟达宣布低延迟推理加速器 Groq 3 LPX 进入全面量产,该芯片设计用于扩展 Vera Rubin NVL72 系统。
据 Artificial Analysis 测试,Groq 3 LPX 运行 Gemma 4 31B、100K token 上下文时达到 3400 output tokens/秒,英伟达称其面向延迟敏感的 agent 工作负载,响应速度比最接近的竞品快 4 倍。
架构上将推理任务拆分:Rubin GPU 负责大规模上下文处理,LPX 负责快速 token 生成,目标场景为编码 agent、多步推理与工具调用。Nebius 将成为首个部署 Groq 3 LPX 的 AI 云(通过 Nebius Token Factory)。
所属事件:英伟达 Groq 3 LPX 全面量产,推理速度达 3400 token/秒(2 条相关)→
「Infra」频道最新
- SpaceXAI 采用 NVIDIA Vera 加速智能体运算与卫星部署 — nvidia · 2026-08-25
- Protocol Labs 终止 Shipyard 的 IPFS 资金,项目将关停 — jedisct1 · 2026-08-25
- OpenRouter 被 Stripe 收购,年处理 4.5 千万亿 token — rohanpaul_ai · 2026-08-25
- OpenRouter 周调用量半年激增 9000 倍 — rohanpaul_ai · 2026-08-25
- Hot Chips 大会重头戏即将开始 — firstadopter · 2026-08-25
- Teutonic-II-110B 发布:探索基于 Loss 市场的去中心化训练 — markjeffrey · 2026-08-24