循环复用 Transformer 块:260M 小模型以 4.9 倍低算力胜过 6.5 倍大模型
arankomatsuzaki · x · 2026-10-01
Arankomatsuzaki 转发了新论文 Looped Diffusion Transformer(Looped-DiT),提出文本生图模型的另类扩展路径:
- 核心思路:在每个去噪步骤内反复运行共享的 Transformer 块,以参数量不变的方式增加计算深度,实现内部表征的迭代精炼
- 关键问题与解法:朴素循环因中间步骤监督不足、注意力更新失稳而失效;Looped-DiT 通过跨循环深监督与自调制注意力解决
- 结果:260M 参数的循环模型在多个 T2I 基准上超越 6.5 倍大的模型,推理算力降低 4.9 倍
- 额外发现:固定推理预算下,加深循环比增加去噪步数收益更大,且深层循环能逐步修正早期错误
作者包括智谱、Sensetime 等机构的研究者与清华大学高煌团队。
「多模态」频道最新
- Aiden Bai 用一段 prompt 让 AI 生成 30 秒游戏预告片,含原创音乐与音效 — aidenybai · 2026-10-01
- 艺术家用神经细胞自动机+Gemini 天气系统打造数字生态 nom nom — zzznah · 2026-10-01
- Stanford NLP 推出 UniEvo-VL:自蒸馏训练让多模态模型自我进化 — stanfordnlp · 2026-10-01
- 用户吐槽 Suno v6 表现太差,音乐生成口碑存疑 — hq4ai · 2026-10-01
- Runway 峰会放出神秘项目 Continuum 抢先预览 — c_valenzuelab · 2026-10-01
- Viggle Turbo v0.3 发布:Qwen 图像 6 步更干净,新增 9 步模式修小字 — init-5 · 2026-10-01