循环复用 Transformer 块,2.6 亿参数模型胜过 6.5 倍大模型
NandoDF · x · 2026-10-03
- 新论文 Looped Diffusion Transformer(Looped-DiT) 提出一条区别于「加大模型/加多去噪步」的算力扩展路径:在每个去噪步内重复运行共享的 Transformer 块,参数量不变而计算深度增加,对内部表征进行迭代精炼。
- 简单循环并不奏效,作者定位到两个问题:中间各轮循环监督信号太弱、注意力更新无约束导致局部信息逐渐被侵蚀。
- 解法是 Deep Supervision(对中间循环施加监督)+ Self-Modulating Attention(稳定循环中的特征更新)。
- 结果:在参数对齐与算力对齐两种设置下均优于非循环基线;260M 参数的循环模型可在多个文生图基准上超过 6.5 倍大的模型,推理算力还低 4.9 倍。
- 另一发现:固定推理预算下,加深循环比增加去噪步收益更大,且更深的循环能逐步纠正早期循环的错误。
「研究」频道最新
- 单条 prompt 让 AI 五分钟内自动发现并验证连续介质力学新模型 — CatAstro_Piyush · 2026-10-04
- EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4% — geoffwolfe · 2026-10-04
- 指数族的 KL 散度等价于 Bregman 散度的理论笔记 — FrnkNlsn · 2026-10-04
- NeuroAgent 通过斑马鱼全脑图灵测试,覆盖约 13 万神经元 — aran_nayebi · 2026-10-04
- UTDallas 智能机器人实验室转向:从感知研究押注可泛化的机器人操作学习 — YuXiang_IRVL · 2026-10-04
- generativist 重读 Chris Olah 信息论长文:看清「可解释性鸿沟」 — generativist · 2026-10-04