Together AI 详解 Rubin 内核博客:从 B200 逐步叠加新特性
togethercompute · x · 2026-09-11
线程第三篇:博客从原始 B200 GEMM 出发,逐步叠加 Rubin 新特性——更宽的 MMA 步长、更多张量/共享内存、B-side collectors、early A release 等。作者称这些内核仍处早期,接下来还有 LUT GEMM、硬件原生 megakernel 与新引擎优化,并感谢 NVIDIA 提供早期访问支持。
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11