Together Compute 发布首批 Rubin GPU 优化 kernel,逐步启用新硬件特性
togethercompute · x · 2026-09-11
Together Compute 发布博客,介绍其为 NVIDIA Rubin GPU 优化 GEMM kernel 的过程:从原有 B200 GEMM 出发,逐步加入 Rubin 的新特性,包括更宽的 MMA step、更多 tensor memory 与 shared memory、B-side collectors、early A release 等。作者强调这些 kernel 仍处早期阶段,后续计划包括 LUT GEMM、硬件原生 megakernels 以及新的引擎层优化,并感谢 NVIDIA 提供早期访问与支持。
所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→
「Infra」频道最新
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11