NanoGPT Speedrun 新纪录 67.6 秒:屏蔽非规范 token 省 15 步训练
kellerjordan0 · x · 2026-09-19
Jan Varho 在 modded-nanogpt 创下 67.6 秒(-0.4 秒) 的 NanoGPT Speedrun 新纪录,核心是一个简单想法:canonical token masking(规范 token 掩码)。
- 多 token 预测(MTP)会把概率质量推向非规范 token:如 "Hyperparameter" 分词为 ["Hyper","param","eter"],但 "eter" 永远不会在 "Hyper" 后出现(因为 "Hypereter" 会分词为别的序列),模型却仍学着预测它
- 显式屏蔽这些不可能的续接 token,既降低 val loss,又防止推理时生成训练中从未见过的 token 组合
- 作者引用论文 arXiv:2506.07956,称这是其 local conditioning 变体;由于只在 eval/推理时掩码,对 loss 可证明地更好
- 实测省下 15 步训练,PR #350 已被合并;基准 1285 步 547 秒降至掩码版 1270 步
一个纯分词层面的观察就换来实打实的训练加速,想法简单但收益清晰。
「研究」频道最新
- 思维链监控不是审计日志:模型解释与其真实决策脱节 — ziv_ravid · 2026-09-19
- 多篇论文质疑思维链忠实性:填充词可涨 13 分,解释常是表演 — ziv_ravid · 2026-09-19
- TokenRhythm 发布 NeoHorse-1:4B/9B,宣称首个 RSI 闭环验证 — jiqizhixin · 2026-09-19
- 用强化学习训练语言模型写代码作画,代码可编辑替代反复调提示词 — measure_plan · 2026-09-19
- Bountied 验证子网十天攻破六道悬置数十年的 Erdős 公开难题 — markjeffrey · 2026-09-19
- 斯坦福学者:基因表达预测模型受限于数据而非规模 — anshulkundaje · 2026-09-19