英伟达 Groq 3 LPX 量产,推理速度达 3400 token/秒
英伟达宣布低延迟交互式 AI 推理加速器 Groq 3 LPX 进入全面量产,该芯片用于扩展 Vera Rubin NVL72 系统。据 Artificial Analysis 数据,其在运行 Gemma 4 31B 模型时实现每秒 3400 个输出 token,创下推理速度纪录。同时,Nebius AI Cloud 宣布成为首个采用该芯片的云服务商,以提升 Vera Rubin NVL72 的 token 生成速度。
2026-08-24 ~ 2026-08-25 · 3 条相关
- 英伟达 Groq 3 LPX 全面量产,推理速度达 3400 token/秒 — zephyr_z9 · 2026-08-24
- Nebius 率先采用 NVIDIA Groq 3 LPX 加速推理 — BenBajarin · 2026-08-25
另有 1 条近重复转述:nvidia