训练不稳别怪 fp16:cuDNN/FA4 反向传播精度有严重 bug
bdsqlsz · x · 2026-10-04
KBlueleaf 团队发现,cudnn、FlashAttention-4、flexattention 等主流 attention kernel 的反向传播都存在严重精度问题:当注意力层学到接近 one-hot 的注意力、logits 超过约 1e5 时,这些 kernel 返回的梯度会错 10 到 1000 倍甚至出现 inf,而前向和 loss 看起来完全正常——很多「训练失败」其实是 kernel 的锅,而不是设计或 fp16 本身的问题。他们因此开源了 KohakuFA:一个用 Gluon(Triton tile 方言)写的 Blackwell(sm100+)flash attention 实现,用 tcgen05 MMA、TMA 和 warp specialization,支持 dense、token-causal 和 block-causal 注意力,其 fp16 梯度在该场景下能贴近 fp64/FlashAttention-2 的精度下限。细节见仓库 docs/precision.md。
「Infra」频道最新
- RL 并非取代预训练:密集信号仍让它不可或缺 — akbirthko · 2026-10-04
- Bain:超大规模数据中心正走向 5GW 量级,单座投资 1500-2000 亿美元 — Beth_Kindig · 2026-10-04
- 现货约150-300张H100短期出租,含IB网络与高速本地存储 — AccBalanced · 2026-10-04
- 算力短缺下,二线算力云被迫在忠于 NVIDIA 与采购多元芯片间抉择 — AccBalanced · 2026-10-04
- 16GB 显存跑 176B MoE:TensorSharp 实测胜过 Strata — fuzhongkai · 2026-10-04
- 云厂商没动力做端侧模型:推理收入与本地部署的激励错位 — AccBalanced · 2026-10-04