重设计 DiT 残差连接:训练迭代减少 1.73 倍,FID 降至 1.39
NationalUniversityofSingapore · hf · 2026-09-29
新加坡国立大学团队提出重新思考扩散 Transformer(DiT)的残差连接:DiT 目前用统一的残差流把所有前层整合成单一状态,而该工作通过系统分析发现 DiT 内部存在对早期特征复用和对称层引导的潜在偏好。
据此他们提出结构化连接设计,把残差连接从被动求和变成主动的「检索」机制:每个 transformer 块可通过可微的跨深度路径,选择性关注关键的早期表示,动态获取空间与语义线索,而非静态 skip connection 或全层密集路由。
效果:收敛更快,训练迭代最多减少 1.73 倍;仅增加不到 0.1% 参数即在 FID 与视觉质量上显著提升——在 REPA-XL/2 上无引导 FID 从 5.9 降到 4.34,配合 classifier-free guidance 达到 1.39 FID。作者认为自适应跨层连接是扩散 Transformer 中被低估的关键因素。
「多模态」频道最新
- 同一提示词对决:Opus 5.5 Max effort vs Grok 4.7 Fast xhigh 生成动态视频 — FinanceYF5 · 2026-09-29
- 用「顶级动态设计师」提示词实测 Opus 5.5 Max effort 视频生成 — FinanceYF5 · 2026-09-29
- ComfyUI 新手求助:如何分离控制姿势、身份与背景参考图 — butterfly--1313 · 2026-09-29
- 实测为 Qwen 图像模型加 LoRA,显著改善暗脏出图问题 — Comfortable-Mind4875 · 2026-09-29
- 独立开发者用 AI 打造 Manus 风格宣传片,为产品 CellMotion 助阵 — yihui_indie · 2026-09-29
- Kling 4.0 今日发布,创作者实测:唇形同步与 15 个参考图成亮点 — tomchapin · 2026-09-29