Rowmax-H15:B200 上注意力前向最高提速 25.8%
illinois · hf · 2026-09-30
研究者在 10 个冻结 decoder-only 模型(0.5B–72B)上系统研究预训练 Transformer 推理时 softmax 可以近似到什么程度。
发现:
- B200 上张量核吞吐比特殊函数指数吞吐高两个数量级以上,指数计算成为融合注意力内核瓶颈,而模型并不需要在每个元素上精确计算它。
- softmax 赋概率的位置数与行内分辨率都可大幅削减,但均匀加权同样位置会严重损害;分辨率预算放在行最大值附近始终更优;相同标量畸变在不同模型上产生符号相反的反应。
提出:
- Rowmax-PoT:锚定在每行最大值的粗粒度对数权重表示;
- Rowmax-H15:FlashAttention-4 中的硬件特化版本。
实测(B200):FP8 注意力前向 causal 8K 提速 12.4%,non-causal 8K 提速 25.8%;causal 16K 每次前向板级能耗降 8.4%;BF16 路径 2K 下五模型困惑度仅升 0.091–0.492%。
「Infra」频道最新
- 18 个月智能-成本前沿巨变:从 GPT-5 mini 17 分到 Opus 5.5 拿下 58 分 — ArtificialAnlys · 2026-09-30
- Google Project Suncatcher 首次将 TPU 送入太空,10 月 1 日随火箭升空 — allisondman · 2026-09-30
- Photon 2.6 发布:FP8+投机解码,B200 上 Qwen3.5 27B 跑出 400 tok/s — Bedrovelsen · 2026-09-30
- SGLang 把 Qwen3.8-27B 变决策模型,百毫秒内通关宝可梦火红 — zhaoran_wang · 2026-09-30
- Agent 时代 CPU 成新瓶颈:Vera 单独部署预示 CPU:GPU 比例将上调 — AccBalanced · 2026-09-30
- AT&T CEO 放话:SpaceX 手机卫星策略「行不通」 — RachelVT42 · 2026-09-30