VC-Attention 免重训实现 B200 上 1.6 倍注意力加速,直击视频生成 softmax 瓶颈
songhan_mit · x · 2026-09-17
MIT、CMU、UC Berkeley、Stanford 与 NVIDIA 研究者联合推出 VC-Attention,面向视频生成等场景的低比特注意力加速:
- 问题:低比特注意力对快速视频生成很有前景,但 softmax 仍是 B200/B300 上的主要瓶颈。
- ExpCast-FP8:用简单的线性映射到 FP8 码字,绕开销贵的指数运算和类型转换,加速 softmax。
- V-Smooth:降低 value 量化误差,保真度优于 SageAttention2。
在 MiniMax-H3 上,相比 BF16 FlashAttention-4 注意力提速 1.6 倍(B200)和 1.5 倍(B300);专有扩展 Nunchux Attention 可达 1.9 倍/1.8 倍。无需重训,可与现有稀疏注意力方法叠加,让多模态推理更快更便宜。已发布博客与技术报告。
所属事件:VC-Attention 免训练低比特注意力在 B200 上提速 1.6 倍(2 条相关)→
「Infra」频道最新
- 钙钛矿或成美国太阳能翻身关键,效率天花板从30%升到45% — kyliebytes · 2026-09-17
- 编译器老兵复盘:移动浪潮终结同构计算,逼出 TPU/NPU 时代 — blelbach · 2026-09-17
- 从 x86 一统天下到架构碎片化:软件人将再度为硬件买单 — blelbach · 2026-09-17
- 低精度挖矿见底,硬件老兵称稀疏计算是 AI 下一个 10x — blelbach · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17
- 美联储三年来首次加息,抬高债务驱动 GPU 集群的融资门槛 — rohanpaul_ai · 2026-09-17