ThunderKittens 适配 NVIDIA Rubin:NVFP4 GMM 冲上 22 PFLOPS
HazyResearch · x · 2026-09-11
Together AI 的 kernels 团队获得 NVIDIA Vera Rubin NVL72 早期访问权限,花几天时间钻研新 ISA,把 thunderkittens 内核成功移植到 Rubin 平台。
- 团队为 Rubin 重写了内核,实现 nvfp4 与 fp8 两种 GEMM
- 分别跑出超过 22 和 12 PFLOPS 的性能,可与 cuBLAS + CUTLASS DSL 竞争
- 团队称移植过程顺畅,并发布了博客详述新更新
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- 芯片初创 Kepler 出 stealth:冲击 HBM/SRAM 之外的新型 AI 内存,或获 2.45 亿美元政府支持 — npinto · 2026-09-11
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11