Vera Rubin 推理性能曝光:每瓦性能达 GB200 五倍
downingARK · x · 2026-07-30
SemiAnalysis 发布了英伟达下一代 Vera Rubin NVL72 与当前 GB200 NVL72 的推理 TCO 与架构深度分析。
- 性能跃升:工程样本显示,运行 DeepSeek R1 时,Vera Rubin 的每瓦性能(Performance per MW)是 GB200 的 5.4 倍,每美元性能(Performance per dollar)提升 5 倍。由于 Rubin 目前仍处于早期点亮阶段,预计未来优势还将进一步扩大。
- 软件栈平滑过渡:英伟达已随 CUDA 13.4 发布首个 Rubin (SM107) 软件栈,并将相关 PR 上游至 PyTorch、vLLM 和 OpenAI Triton。与 Blackwell 无法复用 Hopper 内核不同,Rubin 可直接复用 Blackwell 的 WGMMA 内核,大幅加快了上市时间。
- 底层架构演进:文章详细解析了 Rubin 全新的 3 bit 可编程 LUT 张量核心。此外,GitHub 信息显示下一代 Feynman 架构 代号为 SM140,从 Rubin 到 Feynman 的内核过渡将变得更为复杂。
「Infra」频道最新
- 云营收增长大比拼:谷歌云 Q1 增速 63% 远超亚马逊微软 — Beth_Kindig · 2026-07-30
- 1-bit 量化显神威:Kimi K3 成功在 Mac Studio 本地运行 — danielhanchen · 2026-07-30
- LMSYS 推出 Miles 训练栈:原生支持 Blackwell 8-bit 与 4-bit RL — BanghuaZ · 2026-07-30
- llama.cpp 更新:默认加载 MTP 张量致显存多耗一层 — Shoddy_Bed3240 · 2026-07-30
- 开源社区发力:Mac端大模型推理速度突破提升80.6% — gajesh · 2026-07-30
- Kimi K3 首日原生支持 vLLM 与 AMD,2.8T 参数可跑在 Instinct — vllm_project · 2026-07-30