重设计 DiT 残差连接:训练迭代减少 1.73 倍,FID 降至 1.39

NationalUniversityofSingapore · hf · 2026-09-29

新加坡国立大学团队提出重新思考扩散 Transformer(DiT)的残差连接:DiT 目前用统一的残差流把所有前层整合成单一状态,而该工作通过系统分析发现 DiT 内部存在对早期特征复用和对称层引导的潜在偏好。

据此他们提出结构化连接设计,把残差连接从被动求和变成主动的「检索」机制:每个 transformer 块可通过可微的跨深度路径,选择性关注关键的早期表示,动态获取空间与语义线索,而非静态 skip connection 或全层密集路由。

效果:收敛更快,训练迭代最多减少 1.73 倍;仅增加不到 0.1% 参数即在 FID 与视觉质量上显著提升——在 REPA-XL/2 上无引导 FID 从 5.9 降到 4.34,配合 classifier-free guidance 达到 1.39 FID。作者认为自适应跨层连接是扩散 Transformer 中被低估的关键因素。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →