Token 超叠加预训练点子:giffmana 称做过类似实验但效果惨淡
giffmana · x · 2026-09-19
gordicaleksa 提出预训练想法 TST(Token Superposition Training):预训练初期不逐 token 处理,而是把相邻 s 个 token 的 embedding 取平均压成一个 latent token,用它预测下一个不重叠的 s-token 包(如 s=4 时 [A B C D]→均值→预测 {E,F,G,H}),灵感部分来自视觉的分辨率概念。giffmana 回复称自己做过受视觉分辨率启发的相关实验,但结果「大多是灾难」——为这个方向提供了重要的负面经验。
所属事件:Token 叠加训练新思路:10B MoE 模型省 2.5 倍算力(2 条相关)→
「研究」频道最新
- 把 reranker 改成决策引擎,Jev 式 API 电车难题永远拉杆 — gaganghotra_ · 2026-09-19
- 连续扩散语言模型新技巧:仅增 1-3% 推理算力即可引导生成 — itsbautistam · 2026-09-19
- 用 LLM 算历代名将 WAR:拿破仑稳居历史第一 — ctjlewis · 2026-09-19
- MIT 新论文追踪 10.8 万个开源模型的生命周期兴衰 — asusarla · 2026-09-19
- Meta Muse + Jev 十秒级筛出免疫学百大未解问题 — DeryaTR_ · 2026-09-19
- 26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100% — ddkang · 2026-09-19