NVIDIA 展示 LPX 推理优化:Gemma 4 速度破万

NVIDIA LPX 团队发布技术博客,展示模型推理优化的最新进展。在高质量设置下,Gemma 4 推理速度突破 1 万 OTSU;另一项在 Vera Rubin 平台上的 Groq 3 LPX 实测中,Gemma 4 31B 模型在 100K 上下文场景下跑出 3431 tok/s 的成绩,数据表现引人注目。

2026-08-25 ~ 2026-08-25 · 2 条相关