ThunderKittens 登上 Vera Rubin:NVFP4 GEMM 跑出 22 PFLOPS
togethercompute · x · 2026-09-11
Together AI 内核团队获得 NVIDIA NVL72 早期访问,翻阅新 ISA 后将 NVFP4 与 FP8 GEMM 内核移植到 Vera Rubin,分别推过 22 和 12 PFLOPS,性能可与 cuBLAS + CUTLASS DSL 竞争。团队称 Rubin 上最大的变化是张量核心取操作数的速度翻倍,但仅加宽 MMA 不够,还需提高数据复用、加深流水线等才喂得饱核心,最终把 16k NVFP4 GEMM 推至 22.4 PFLOPS。
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- Bartowski 发文解析 GGUF 量化新方案:按张量布局映射分配位宽 — bartowski1182 · 2026-09-11
- antirez 在 128GB M5 Max 上跑 DeepSeek v4.1 Flash,SSD 流式加载快得出乎意料 — antirez · 2026-09-11
- 分析称 OpenAI 仍有约 7 倍训练算力余量,开源差距只是暂未拉开 — soumitrashukla9 · 2026-09-11
- DeepSeek 发布 V4.1-Flash,同周曝 Nvidia 200 亿美元 Groq 交易遭 DOJ 审查 — eyishazyer · 2026-09-11
- Persimmon 训练细节:基于 NVIDIA 550B Nemotron,数千块 Blackwell GPU — niloofar_mire · 2026-09-11
- NVIDIA 详解 EPD 分离架构:多模态推理首字延迟最高提速 5 倍 — NVIDIAAI · 2026-09-11