Adobe 提出 Chimera:混合视觉扩散 Transformer,FLOPs 降低 7.3 倍
burny_tech · x · 2026-08-14
Adobe Research 的论文《Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers》提出了一种混合 DiT 架构,用于长上下文视觉生成。它用 KDA 线性注意力替换大部分全注意力,引入周期性 MLA 进行全局 token 混合,使用模态感知短卷积处理时空局部性,并采用 MoE 增加稀疏容量。该异构主干在宽度和深度上可预测扩展。结果显示,达到相同 loss 时 FLOPs 比 Wan 2.1 2B 少 7.3 倍,并支持零样本从 5 秒外推到 30 秒视频,无需长度微调。
「研究」频道最新
- AutoDesign:将智能体框架纳入优化循环,论文生成海报超越Claude Design — dair_ai · 2026-08-15
- Qwen3.8-27B与3.6架构完全相同,能力提升全靠训练改进 — Course_Latter · 2026-08-15
- Notion 发布真实工作负载评测:开源模型质量达 94-98%,成本低至 0.02 美元 — ivanhzhao · 2026-08-15
- MLA+MTP或非良配:从算术强度看注意力机制优化 — tokenbender · 2026-08-14
- Notion 发布真实工作负载评测:开源模型质量达 94-98%,成本低至 0.02 美元 — ivanhzhao · 2026-08-14
- OpenRouter推出Web搜索基准测试,涵盖多模型与配置排名 — AravSrinivas · 2026-08-14