腾讯混元开源 Prism:动态稀疏注意力让 2K 视频-音频联合训练提速 2.5 倍
Tencent-Hunyuan · hf · 2026-10-06
腾讯混元团队发布 Prism,一个面向原生 2K 分辨率视频-音频联合生成模型训练的动态稀疏注意力框架。
- 问题:全注意力的二次方开销在高分辨率下成本过高,且注意力被冗余 token 稀释,削弱对信息量高的内容的训练信号;现有稀疏注意力方法要么只做免训练加速,要么忽视了联合视频-音频数据中跨模态交互天然集中在发声区域的独特结构。
- 方法:将 token 序列组织成时空宏区(macro-zone),通过视频通道方差和音频到视频交叉注意力范数估计每个区域的信息结构与音视频耦合强度,动态为每个区域分配定制的块形状,在视觉变化快、音视频耦合强的轴向上做更细的划分;再配合混合块选择策略按查询动态决定稀疏度。
- 结果:相比全注意力训练加速 2.5 倍,生成质量还更好。
所属事件:腾讯混元开源 Prism,助力 2K 视频音频联合生成(2 条相关)→
「多模态」频道最新
- Martian 展示「火星,巍峨壮丽」生成图 — Kyrannio · 2026-10-06
- Seedance 2.5 实测:一段被称「杰作」的 AI 视频 — SimplyAnnisa · 2026-10-06
- 作者翻出 4 年前写的 UE5 AutoLOD 工具,适配 GenAI 3D 资产优化 — rms80 · 2026-10-06
- 实测 AI 3D 网格生成:百万面片、UV 混乱,全面拉胯 — rms80 · 2026-10-06
- 免费浏览器姿势工具 PoseForm:摆姿势直接导出 OpenPose 与 ControlNet — Upstairs-Lead-2601 · 2026-10-06
- 阿斯塔纳 AI 电影节:8067 部作品角逐,45 万美元大奖揭晓 — lmoroney · 2026-10-06