ThunderKittens 内核跑上 Rubin:团队改写 ISA,nvfp4/8 GEMM 达 22/12 PFLOPS
simran_s_arora · x · 2026-09-11
Together AI 的内核团队获得 NVIDIA Vera Rubin NVL72 早期访问权限,几天内研读新 ISA 并把 ThunderKittens 移植到 Rubin GPU 上,实现 nvfp4 和 fp8 GEMM,分别跑出超过 22 和 12 PFLOPS 的成绩,与 cuBLAS 和 Cute DSL 相当甚至有竞争力。
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11