NVIDIA Groq 3 LPX 实测:Gemma 4 跑出 3431 tok/s
ricklamers · x · 2026-08-25
NVIDIA 发布技术博客,详细介绍 Groq 3 LPX 加速器在 Vera Rubin 平台上的性能表现。在与 Gemma 4 31B 模型的测试中,该系统在 100K 上下文窗口下实现了中位数 3,431 tokens/秒 的输出速度,在高算力负载场景下最高达到 10,996 tokens/秒。架构上,系统利用确定性编译器调度、细粒度计算通信重叠及预规划片间网络,最小化了首比特延迟。此外,Groq 3 LPX 支持多种协同执行配置(如预填充-解码分离、推测性外部草稿解码),旨在为万亿参数模型提供最佳能效比与交互速度。
所属事件:NVIDIA 展示 LPX 推理优化:Gemma 4 速度破万(2 条相关)→
「Infra」频道最新
- 西弗吉尼亚拟吸引数据中心,配套核电站成优势 — mimi10v3 · 2026-08-25
- JetBrains 本地 AI 选 Qwen3.6 27B 优化编程体验 — Danmoreng · 2026-08-25
- SpaceX 拟部署百万卫星配英伟达算力,Grok 规模将扩至 10GW — ns123abc · 2026-08-25
- Weaviate 推出可配置 effort 参数,测试时计算提升检索精度 — CShorten30 · 2026-08-25
- 高通收购 Modular:联手打造异构计算开放软件栈 — clattner_llvm · 2026-08-25
- 如何在本地完全运行 LLM 以确保数据不外泄 — gethackteam · 2026-08-25