量化 softmax 预训练 Transformer:K=16 时验证损失仅增 0.004 nats

illinois · hf · 2026-09-30

伊利诺伊大学研究低精度训练中被忽视的 softmax 环节:注意力矩阵乘法已普遍量化,但 softmax 通常保持高精度。作者提出 K-interval attention,用 K+1 个网格值近似指数,系统消融了逐行网格校准、插值 vs 硬取整、直通代理相对归一化的位置等选择,并推导了含校准导数的反向规则。

在模型、数据、优化器对齐的预训练实验中(124M 参数、2.5B token):

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →