Telescopic LM:一次训练任意深度可用,质量-预算曲线省 43%
iScienceLuvr · x · 2026-09-29
arXiv 论文提出 Telescopic Language Model(TLM):训练一个嵌套容量的 Transformer,每步做两次前向-反向——一次随机截断容量轴前缀对齐完整 next-token 目标,一次全容量训练——无需改架构、推理时零额外开销,使模型在任意深度截断都是一个有效的语言模型。
论文对比固定出口的 Matryoshka 类方案(如 MLMS),指出只监督少数固定出口会让其他深度 perplexity 飙到 10^2–10^5。在 200M 参数代理套件(20B FineWeb-Edu tokens,各方法同一数据流)上,单次 TLM 训练使全部 20 个层前缀在 perplexity 及敏感下游任务上都可用,质量-预算曲线下面积相对固定出口套件降低 43–44%,全容量性能持平,每次训练 GPU 成本还低约 12%。前缀采样密度是可调旋钮:集中到少数深度即可退化为固定出口方案。
「研究」频道最新
- HCOMP 2026研究:量化众包悬赏任务的证明负担 — windx0303 · 2026-09-29
- 频率学派只修「跑两次回归报一次」漏洞,统计学者开炮 — RexDouglass · 2026-09-29
- 预注册是频率派专利?贝叶斯派:它只是一年前的先验 — RexDouglass · 2026-09-29
- 仅 5000 欧训练出 <300M 参数图像模型,号称同级 SoTA 达 SD1.5 水平 — incorporo · 2026-09-29
- 11k H100 小时实证:便宜验证器足以胜任 LLM 后训练 — iScienceLuvr · 2026-09-29
- ROFT:只用自我复盘解释微调,SWE-bench 成绩追平 GRPO — iScienceLuvr · 2026-09-29