NVIDIA Groq 3 LPX 实测:长上下文输出 3431 tokens/秒
scaling01 · x · 2026-09-01
NVIDIA 技术博客介绍 Groq 3 LPX——面向 Vera Rubin 平台的交互式 AI 推理加速器。第三方 Artificial Analysis 在 100K 上下文下测试 Gemma 4 31B,测得中位输出速度 3,431 tokens/秒;在 SPEED-Bench 编码基准上中位达 4,767 tokens/秒,P80 为 5,520 tokens/秒。
其核心是确定性执行模型:由编译器调度芯片间通信,并实现细粒度计算-通信重叠。Groq 3 LPX 可与 Vera Rubin NVL72 组合成 prefill-decode 分离、attention-FFN 分离、外部 drafter 投机解码等架构。
「Infra」频道最新
- 花 6 万美元组 Mac 集群跑本地 LLM,性能仍不及 10 美元订阅 — leebase65 · 2026-09-01
- LangChain 创始人呼吁:谁来做 Agent 的开源版 Codex 浏览器? — hwchase17 · 2026-09-01
- Qwen2.5-72B 本地推理:35 tok/s vs 65 tok/s 配置解析 — LittleCelebration412 · 2026-09-01
- 质疑 NVIDIA MIG 实例上限,B300 为何仍限 7 个 — StasBekman · 2026-09-01
- 预测:69% 概率美国某州将在 2026 年前实施数据中心禁令 — Polymarket · 2026-09-01
- NVLink 生态加深 NVIDIA 硬件投资壁垒 — BenBajarin · 2026-09-01