Adobe 提出 Chimera:高效长上下文视觉扩散架构
adobe · hf · 2026-07-31
Adobe 推出了 Chimera,一种混合视觉扩散 Transformer 骨干网络,旨在解决高分辨率图像和长视频生成中全注意力机制带来的二次方计算成本问题。
架构设计:
- 采用单一光栅顺序流处理文本、图像和视频 token,无需位置嵌入。
- 结合 Kimi Delta Attention (KDA) 处理长上下文,穿插多头潜在注意力 (MLA) 进行全局交互,并使用模态感知短卷积提取局部时空上下文。
- 引入稀疏混合专家 层以在不增加激活计算量的前提下扩展模型容量。
Scaling Law 与实验成果:
- 提出 HeterP 超参数转移方案,拟合了针对激活参数量、训练 token 数及图文视频比例的 Chinchilla 级计算最优定律。
- 训练了 110 亿参数 (激活参数 20 亿) 的模型。在预训练扩散损失指标上,其计算效率是同等规模全注意力基线 的 1.7 倍,系统整体效率达 7.3 倍。
- 具备出色的零样本泛化能力:无需针对长度微调,即可从 5 秒训练片段外推生成 30 秒视频,最后 5 秒的 FID 仅下降 6.5%。
「多模态」频道最新
- 曝 MiniMax H3 模型曝光:支持原生多模态,最多混合 12 种输入 — bennash · 2026-07-31
- H3-Omni 架构解析:原生 2K 分辨率与上下文重绘技术 — bdsqlsz · 2026-07-31
- Flux 3 与 Minimax H3 宣布开源权重,视频生成再起波澜 — cocktailpeanut · 2026-07-31
- Runway 视频生成实测:图生 15 秒孟买雨季延时摄影 — CurieuxExplorer · 2026-07-31
- 实测 Hailuo-03 模型的参考图生成能力 — chrisfirst · 2026-07-31
- MiniMax-H3 登顶视频编辑榜,文生视频并列全球第二 — bdsqlsz · 2026-07-31