VC-Attention 免训练低比特注意力:B200 上提速 1.6 倍,超越 FlashAttention-4
xiuyu_l · x · 2026-09-17
Nunchux AI 联合 MIT、CMU、UC Berkeley、Stanford 与 NVIDIA 研究者发布 VC-Attention:无需重训练的快速精准低比特注意力推理方案。
核心数据(在 MiniMax-H3 视频生成、243 帧 1344×768 负载下,相对 BF16 FlashAttention-4):
- VC-Attention:B200 提速 1.59×,B300 提速 1.51×
- 专有扩展 Nunchux Attention:B200 达 1.91×,B300 达 1.83×
- 保真度优于 SageAttention2:100 个 prompt 平均 PSNR 20.2 dB vs 19.9 dB
两项关键创新:
- V-Smooth:降低 value 量化误差(按部署调度在前 1/4 去噪步开启)
- ExpCast-FP8:加速 softmax
方案兼容现有稀疏注意力方法,团队定位是多模态/世界模型推理加速——对视频生成而言注意力是最重的算子。附博客与技术报告。
「Infra」频道最新
- GPU 价格仍在上涨,算力供不应求成行业共识 — firstadopter · 2026-09-17
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17
- 推理并发越低模型越聪明?聊聊量化与GEMV的玄学猜想 — karminski3 · 2026-09-17
- 孟菲斯大学研究:xAI Colossus 1 运营一年周边空气未见明显恶化 — TinfoilTricorn · 2026-09-17
- Beam 上线半年即每 30 分钟处理约 1TB 带宽流量 — markjeffrey · 2026-09-17
- mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标 — HankYeomans · 2026-09-17