NVIDIA Groq 3 LPX实测:小模型解码速度超3400 tok/s
NVIDIA 的 Groq 3 LPX 加速器基准测试显示,Gemma 4 31B 模型在 10k 与 100k 输入序列下平均输出速度均约 3400 tokens/s,刷新解码速度纪录。该系统以 128GB 超快 SRAM 替代 HBM,专为小模型高吞吐解码而设计,展现出在低延迟、大规模推理场景下的性能优势。
2026-08-27 ~ 2026-08-27 · 2 条相关
- Gemma 4 31B 在 Groq 3 跑出 3431 tok/s — GlennCameronjr · 2026-08-27
- Nvidia Groq 3 LPX 系统实测:小模型解码超 3400 tok/s — Jsevillamol · 2026-08-27