采样 softmax 为何把训练提速 1.7 倍:X/@tokenbender 拆解其偏差代价

tokenbender · x · 2026-09-29

@tokenbender 在看到 67→39.9s 的训练提速后拆解了背后的原理:LM head 加上对 5 万个 logits 的交叉熵,每步训练都吃掉相当大比例算力,而采样 softmax 是个近似技巧。

为什么有效: 按 Zipf 分布,概率质量集中在几千个 logits 上,不必对全部 5 万个 logits 计算交叉熵,在这个规模下几乎不损失精度,所以能带来大幅加速。

代价是什么: 采样 softmax 本质上做了自归一化(self-normalizing),即使近似得很好也存在严重偏差——系统性欠训练尾部 logits。作者比喻:就像只采访社区里最有名的人,却把他们的观点当作全体民众的意见。结论是"近似有效、思路聪明",但偏差代价要心里有数。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →