NVIDIA 技术博客:Gemma 4 推理速度突破 1 万 OTSU
ricklamers · x · 2026-08-25
NVIDIA 的 LPX 团队发布技术博客,展示了在模型推理优化方面的最新进展,公布了一些令人印象深刻的数据。
性能数据:
- Gemma 4:在高质量设置下达到了 10,996 OTSU 速度;在 100K 输入上下文窗口的完整负载中,中位数 OTSU 达到 3,431。
- 大模型优化:利用 Vera Rubin 和 LPU drafts 处理 2T 规模模型,实现了 1000 tok/s 的交互速度,并拥有最佳的 tok/watt 能效比。
所属事件:NVIDIA 展示 LPX 推理优化:Gemma 4 速度破万(2 条相关)→
「Infra」频道最新
- 开发者复刻 Groq LPU 用于运行 MicroGPT — IgorCarron · 2026-08-25
- NVIDIA Groq 3 LPX 投产:3400 tokens/s 助力 Agent 飞驰 — heypearlai · 2026-08-25
- 英伟达战略揭秘:通过投资开源生态对冲 OpenAI 与 Anthropic — markjeffrey · 2026-08-25
- Claude 企业版 MCP 连接器集中认证现已上线 — EricBuess · 2026-08-25
- FreeToken 引擎发布:8GB 显存即可跑 290B 边缘 MoE 模型 — Saboo_Shubham_ · 2026-08-25
- Meta 出租 AI 基础设施难成云巨头,专家泼冷水 — DavidLinthicum · 2026-08-25