Token 超叠加预训练点子:giffmana 称做过类似实验但效果惨淡

giffmana · x · 2026-09-19

gordicaleksa 提出预训练想法 TST(Token Superposition Training):预训练初期不逐 token 处理,而是把相邻 s 个 token 的 embedding 取平均压成一个 latent token,用它预测下一个不重叠的 s-token 包(如 s=4 时 [A B C D]→均值→预测 {E,F,G,H}),灵感部分来自视觉的分辨率概念。giffmana 回复称自己做过受视觉分辨率启发的相关实验,但结果「大多是灾难」——为这个方向提供了重要的负面经验。

所属事件:Token 叠加训练新思路:10B MoE 模型省 2.5 倍算力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →