Telescopic LM:一次训练任意深度可用,质量-预算曲线省 43%

iScienceLuvr · x · 2026-09-29

arXiv 论文提出 Telescopic Language Model(TLM):训练一个嵌套容量的 Transformer,每步做两次前向-反向——一次随机截断容量轴前缀对齐完整 next-token 目标,一次全容量训练——无需改架构、推理时零额外开销,使模型在任意深度截断都是一个有效的语言模型。

论文对比固定出口的 Matryoshka 类方案(如 MLMS),指出只监督少数固定出口会让其他深度 perplexity 飙到 10^2–10^5。在 200M 参数代理套件(20B FineWeb-Edu tokens,各方法同一数据流)上,单次 TLM 训练使全部 20 个层前缀在 perplexity 及敏感下游任务上都可用,质量-预算曲线下面积相对固定出口套件降低 43–44%,全容量性能持平,每次训练 GPU 成本还低约 12%。前缀采样密度是可调旋钮:集中到少数深度即可退化为固定出口方案。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →