NVIDIA Warp 发散代价仍线性增长,覆盖 Pascal 到 Blackwell
Alpin Dale · hf · 2026-07-28
论文结论
这篇工作重新审视了 NVIDIA GPU 上的 warp divergence,覆盖 Pascal、Ampere、Hopper 和 Blackwell,方法包括周期级微基准、硬件计数器和编译器生成的 SASS 反汇编分析。
主要发现
- 分支发散的开销与路径数 k 线性增长:T(k) ≈ s·k
- 没有观察到超线性的 reconvergence 惩罚
- warp 执行效率按 32/k 下降
- 这个代价 与 occupancy 无关
- 使用 predication 可以消除串行化成本
- 这种程序员可见的成本模型在 Pascal 上就已经存在,早于 ITS(Independent Thread Scheduling)
编译器/ISA 变化
- Pascal 通过每个 warp 的 SSY/SYNC 指令栈实现 reconvergence
- 新一代架构改用 barrier register 指令
- 迟于 immediate post-dominator 的 reconvergence 案例从 Ampere 的 29 个降到 Blackwell 的 2 个
- Blackwell 还引入了两级 convergence-barrier 分类、uniform-branch 指令和显式的 partial-mask warp synchronization
- 位翻转实验显示,这种新的 barrier 分类更像是 静态编译器分类,在测试中没有可观测的运行时效果
结论
warp divergence 的性能代价在多代 NVIDIA GPU 上依然稳定、可预测;变化更多发生在控制流 ISA 和 reconvergence 机制本身,而不是程序员最终看到的开销模型。
所属事件:研究称英伟达 GPU warp 分歧代价跨代仍呈线性(2 条相关)→
「Infra」频道最新
- Alphabet 未来12个月资本开支预计升至2500亿美元 — FinanceYF5 · 2026-07-28
- 三星芯片员工转投 SK Hynix,47.6 万美元奖金引爆人才战 — nordicinst · 2026-07-28
- Hydra 按置信度把本地任务路由给最便宜的模型 — jhaankit373 · 2026-07-28
- SingularityAPI 把多款开源模型封装进统一 OpenAI 兼容接口 — Individual_Team_2344 · 2026-07-28
- 算力成本飙升逼出自研芯片,但 Nvidia 仍很难打 — FinanceYF5 · 2026-07-28
- 梗图把数据中心和蜜蜂并置,讽刺算力代价 — iamaliveix · 2026-07-28