喂饱 Rubin 张量核心:加宽数 MMA 不够,还要提复用加深流水线
togethercompute · x · 2026-09-11
同一线程续文:作者解释 Rubin 上最大的变化是张量核心消费操作数的速度翻倍,但仅加宽 MMA 并不足够——团队同时提升了数据复用、加深流水线等才让核心吃饱,最终将 16k NVFP4 GEMM 推至 22.4 PFLOPS。
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11