量化 softmax 预训练 Transformer:K=16 时验证损失仅增 0.004 nats
illinois · hf · 2026-09-30
伊利诺伊大学研究低精度训练中被忽视的 softmax 环节:注意力矩阵乘法已普遍量化,但 softmax 通常保持高精度。作者提出 K-interval attention,用 K+1 个网格值近似指数,系统消融了逐行网格校准、插值 vs 硬取整、直通代理相对归一化的位置等选择,并推导了含校准导数的反向规则。
在模型、数据、优化器对齐的预训练实验中(124M 参数、2.5B token):
- 硬取整下 K=4 时,min-max 校准与 pre-normalization 代理组合损失差距很大,任一改动都显著缩小差距。
- 固定窗口校准 + post-normalization 代理:K=4 时验证损失差距 +0.019 nats;pre-normalization 代理在 K=16 时仅 +0.004 nats。
- detach 行极值虽不改变前向计算,但会导致验证损失延迟上升。
「Infra」频道最新
- 新 AI 实验室找 GPU 该找谁?业内投票 SF Compute 居首 — FinanceYF5 · 2026-09-30
- 谷歌向 CNCF 捐赠 Agent Substrate,剑指智能体运行时底座 — rakyll · 2026-09-30
- 微软 WSL Containers 正式发布:wslc 命令行直接在 Windows 跑 Linux 容器 — solyarisoftware · 2026-09-30
- AI 芯片热潮推高韩国税收,预计创历史新高 — Polymarket · 2026-09-30
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- Ubuntu Snapdragon 版 ISO 已开放下载,高通 X2 笔记本可提前体验 — carrycooldude · 2026-09-30