Token 叠加训练:10B MoE 模型省 2.5 倍算力达同等损失
gordic_aleksa · x · 2026-09-19
Aleksa Gordić 解读 Nous Research 的预训练新思路「token superposition training (TST)」:
- 做法:预训练初期不逐 token 处理,而是把相邻 s 个 token 的 embedding 平均成一个 latent token,用它预测接下来不重叠的 s 个 token(softmax 目标各 1/4 权重)。如 s=4 时 [A B C D] 的均值 embedding 预测 {E,F,G,H}。
- 效果:序列位置数减少约 4 倍,同样 FLOPs 可暴露给模型更多原始文本;之后切回标准 next-token 训练恢复精确词序。10B MoE 实验显示达到相当或更好的 loss 只需约 2.5 倍更少算力。
- 直觉:TST 先给文本一个「模糊低分辨率」版本,再用自回归训练「锐化」,类比计算机视觉的 Laplacian 金字塔。
- 关键前提:假设训练处于算力受限而非数据受限状态——作者自嘲这恰与当前「数据受限」的行业共识相反,但仍是值得做的有趣实验。
「Infra」频道最新
- 美国芯片业缺人:仅 3% 工科生流向半导体,其余涌入 AI — ns123abc · 2026-09-19
- Cerebras 用 Qwen3 27B 推出实时个人理财助手 Money Agent — irinarish · 2026-09-19
- Cloudflare 用数学优化一致性哈希,全球再省超100TB内存 — Cloudflare Blog · 2026-09-19
- 开源引擎 Magnitude:先测你的硬件能跑什么本地模型,再自动下载调优 — nickbaumann_ · 2026-09-19
- ContinuityBench 论文:有状态 failover 可保留 99.2% 对话上下文 — its_vayishu · 2026-09-19
- AI 数据中心遭遇电力瓶颈,分析师力推 Bloom Energy 作 2026 首选股 — Beth_Kindig · 2026-09-19