Nebius GB300 NVL72 整机架登顶 MLPerf:DeepSeek R1 每秒 60.3 万 tokens
demian_ai · x · 2026-09-18
Nebius 在 MLPerf Inference v6.1 中拿下 5 个第一:72 卡 GB300 NVL72 整机架在 DeepSeek R1 的 server 与 offline 场景均夺魁,分别约 60.3 万与 69 万 tokens/秒,gpt-oss 120B 推理速度突破每秒 100 万 tokens。Nebius 是本轮仅有的两家提交 Vera Rubin NVL72 预览成绩的实验室之一。
作者给出关键数据:从 8 卡扩展到 72 卡(近 9 倍),速度也近乎线性增长近 9 倍——「单卡快容易,扩展后还快的整机架才是产品」。
「Infra」频道最新
- Postgres 全文搜索 TIN 曝光:p99 比 GIN 快千倍以上 — DanielLockyer · 2026-09-18
- ChatGPT 桌面版默认把文件与代码片段上传云端,教程教换 Ollama 本地运行 — Technovangelist · 2026-09-18
- vLLM 补丁实测:DiffusionGemma 与商业 API 打平且更快落败 — bodonoghue85 · 2026-09-18
- Modular 26.6 发布:Mojo 编译器开放外部贡献,MAX 支持音频生成 — clattner_llvm · 2026-09-18
- 小米 MiMo 实现流式大规模 LLM 强化学习训练,含 1T 参数模型 — stanfordnlp · 2026-09-18
- Gemini 托管 Agent 升级:成本降 30%,新增 Files 与 Credentials API — _philschmid · 2026-09-18