RecCAR 正则化弥合联合视频生成的跨模态注意力差距
barilan · hf · 2026-09-24
- 研究发现联合多模态扩散 Transformer 存在跨模态对应不对称:视频为中枢,伴生模态(3D 人体运动、音频)对视频形成强对应,但反向约束视频的对应显著更弱,作者称之为「互易对应差距」。
- 提出 RecCAR(Reciprocal Cross-modal Attention Regularization),用 KL 正则把较弱的模态到视频对应,对齐到稳定的视频到模态对应分布上。
- 在视频-运动和视频-音频联合生成上,人体解剖评分从 0.69 提升到 0.75,音视频不同步度从 0.804 降至 0.752,整体生成质量同步提升。
「多模态」频道最新
- 快手 Kling 4.0 曝光:120 秒长视频、1080p、4K 生图 — koltregaskes · 2026-09-24
- Limestone 声称 Claude Opus 5.5 一次生成就做出了产品发布视频 — alex_verem · 2026-09-24
- 用 Ling-3.0-flash-VL 读取 8 份 B 超报告,解开孕期「偏小几天」疑惑 — alifcoder · 2026-09-24
- Claude 用数学造吉他、噪声做鼓,一人包办整支乐队 — willcb · 2026-09-24
- Opus 5.5 与 Astra 产出视频动画游戏,网友惊呼媒体生成不用扩散模型 — sirbayes · 2026-09-24
- Qwen Image 2.1 多余 alpha 通道,文件体积白涨 15-20% — Calm_Mix_3776 · 2026-09-24