Token 叠加训练新思路:10B MoE 模型省 2.5 倍算力

Aleksa Gordić 解读 Nous Research 提出的预训练新思路「Token Superposition Training (TST)」:预训练初期不逐 token 处理,而是把相邻若干 token 叠加处理,实验显示 10B MoE 模型可节省 2.5 倍算力达到同等损失。不过 giffmana 表示曾做过类似实验,但效果惨淡,该方法的实际价值仍待验证。

2026-09-19 ~ 2026-09-19 · 2 条相关