采样 softmax 为何把训练提速 1.7 倍:X/@tokenbender 拆解其偏差代价
tokenbender · x · 2026-09-29
@tokenbender 在看到 67→39.9s 的训练提速后拆解了背后的原理:LM head 加上对 5 万个 logits 的交叉熵,每步训练都吃掉相当大比例算力,而采样 softmax 是个近似技巧。
为什么有效: 按 Zipf 分布,概率质量集中在几千个 logits 上,不必对全部 5 万个 logits 计算交叉熵,在这个规模下几乎不损失精度,所以能带来大幅加速。
代价是什么: 采样 softmax 本质上做了自归一化(self-normalizing),即使近似得很好也存在严重偏差——系统性欠训练尾部 logits。作者比喻:就像只采访社区里最有名的人,却把他们的观点当作全体民众的意见。结论是"近似有效、思路聪明",但偏差代价要心里有数。
「研究」频道最新
- Quintin Pope 补充论证:LLM 对数据顺序鲁棒,后门行为本就难以被训练抹除 — QuintinPope5 · 2026-09-29
- 对齐研究者 Quintin Pope:训练后门类实验并不能代表「内优化器」威胁 — QuintinPope5 · 2026-09-29
- 眼睛约 100Hz 的眼球微震颤,或为视觉皮层实现超分辨率 — docmilanfar · 2026-09-29
- AI 从零设计病毒:斯坦福等合成 302 个噬菌体基因组,16 个有效 — CallRevolutionary894 · 2026-09-29
- Reddit 讨论:Softmax 输出仅 N-1 自由度,能否少一层参数? — Kinexity · 2026-09-29
- EAPO:熵引导 credit assignment,让 LLM 推理强化学习更会探索 — coallaoh · 2026-09-29