研究显示 Pascal 到 Blackwell 的 warp 分歧仍线性放大
AlpinDale · x · 2026-07-28
跨代实测显示 NVIDIA GPU 的 warp 分歧代价仍然近似线性
这篇 arXiv 论文用 cycle-accurate 微基准、硬件计数器和编译后 SASS 静态分析,横跨 Pascal、Ampere、Hopper 和 Blackwell 研究 warp divergence 的行为。
主要结论:
- 分歧路径的执行时间基本随路径数 k 线性增长,T(k)≈sk,没有明显的超线性重汇合惩罚。
- warp 执行效率按 32/k 下降,而且这一惩罚与 occupancy 无关。
- 使用 predication 可以消除序列化成本。
- 这种面向程序员可见的成本模型在 pre-ITS 的 Pascal 上就已经存在,因此并不是 Volta 之后才出现。
- 真正变化的是编译器生成的重汇合机制:Pascal 采用 SSY/SYNC 栈,而后续架构改为 barrier-register 指令。
- Blackwell 还引入了双层 convergence-barrier 分类、uniform-branch 指令以及显式 partial-mask warp 同步。
作者的结论是:即使控制流 ISA 和重汇合机制持续演进,warp 分歧的性能代价依然稳定且可预测。
所属事件:研究称英伟达 GPU warp 分歧代价跨代仍呈线性(2 条相关)→
「Infra」频道最新
- 五角大楼拟在十余处美军基地建 AI 数据中心 — Polymarket · 2026-07-28
- 开源代理层拦截 agent 循环并封顶预算 — Electrical-War-549 · 2026-07-28
- FT 截图显示 AI 芯片狂热与抛售同日上演 — nathanbenaich · 2026-07-28
- Kimi-K3 多家推理服务商报价一致,竞争转向延迟和吞吐 — TheZachMueller · 2026-07-28
- Alphabet 未来12个月资本开支预计升至2500亿美元 — FinanceYF5 · 2026-07-28
- 三星芯片员工转投 SK Hynix,47.6 万美元奖金引爆人才战 — nordicinst · 2026-07-28