LIFT 架构让 Transformer 学会深层向浅层反馈,训练保持并行
megamor2 · x · 2026-10-01
作者发布新工作 Latent Information Feedback Transformers(LIFT)。核心问题:LM 生成时信息只通过解码出的 token 从高层向低层传播,形成瓶颈;若直接用状态传播移除瓶颈,模型会变成循环结构,难以并行训练。
- LIFT 是一种 Transformer 架构 + 教师监督训练方法,让模型利用深层到浅层的反馈,同时保持预训练完全并行。
- 在 token 数对齐的预算下,LIFT 在语言建模、下游推理和程序性任务上一致优于标准 Transformer 与基线;算力对齐下持平或领先。
- 在状态追踪任务上,LIFT 用 8 倍更少数据训练仍胜过标准 Transformer。
所属事件:LIFT 架构让 Transformer 实现深层向浅层反馈(2 条相关)→
「研究」频道最新
- 博科尼研究:人人有 AI 的时代,学校最该教因果推理 — daveholtz · 2026-10-01
- DeepSeek Sandbox 论文:智能体自己翻日志找泄露答案、装新包 — mattsheehan88 · 2026-10-01
- 男子用 AI 帮自己的狗设计癌症疫苗,多个肿瘤 reportedly 缩小 — hey_abusiddik · 2026-10-01
- 不到 10 人拿下五大闭源实验室中的四家,Halluminate 融 3000 万美元做 RL 环境 — ycombinator · 2026-10-01
- nanoGPT 竞速赛:AI 智能体 2726 步逼近人类 2600 步纪录 — zsakib_ · 2026-10-01
- openenv 加捕获代理:RL 直接在 Claude Code 等 harness 内训模型 — ben_burtenshaw · 2026-10-01