训练不稳别怪 fp16:cuDNN/FA4 反向传播精度有严重 bug

bdsqlsz · x · 2026-10-04

KBlueleaf 团队发现,cudnn、FlashAttention-4、flexattention 等主流 attention kernel 的反向传播都存在严重精度问题:当注意力层学到接近 one-hot 的注意力、logits 超过约 1e5 时,这些 kernel 返回的梯度会错 10 到 1000 倍甚至出现 inf,而前向和 loss 看起来完全正常——很多「训练失败」其实是 kernel 的锅,而不是设计或 fp16 本身的问题。他们因此开源了 KohakuFA:一个用 Gluon(Triton tile 方言)写的 Blackwell(sm100+)flash attention 实现,用 tcgen05 MMA、TMA 和 warp specialization,支持 dense、token-causal 和 block-causal 注意力,其 fp16 梯度在该场景下能贴近 fp64/FlashAttention-2 的精度下限。细节见仓库 docs/precision.md。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →