Adobe 提出 Chimera:混合视觉扩散 Transformer,FLOPs 降低 7.3 倍

burny_tech · x · 2026-08-14

Adobe Research 的论文《Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers》提出了一种混合 DiT 架构,用于长上下文视觉生成。它用 KDA 线性注意力替换大部分全注意力,引入周期性 MLA 进行全局 token 混合,使用模态感知短卷积处理时空局部性,并采用 MoE 增加稀疏容量。该异构主干在宽度和深度上可预测扩展。结果显示,达到相同 loss 时 FLOPs 比 Wan 2.1 2B 少 7.3 倍,并支持零样本从 5 秒外推到 30 秒视频,无需长度微调。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →