腾讯混元开源 Prism:动态稀疏注意力实现原生 2K 视频+音频联合生成
linoy_tsaban · x · 2026-10-06
腾讯混元联合复旦、浙大开源视频生成模型 Prism,已在 Hugging Face 上线(MIT 许可),主打「原生 2K 分辨率的视频+音频联合生成训练」。
核心方法:
- 用动态稀疏注意力替代全注意力,把 token 序列组织成时空宏区(macro-zone),注意力结构随局部内容自适应
- 通过视频特征通道方差与音频到视频交叉注意力的特征范数,估计各区域信息结构,动态分配定制化的注意力块形状
- 解决高分辨率下注意力被冗余 token 稀释、学习信号变弱的问题;针对联合视频-音频数据中跨模态交互集中在发声区域的特点做稀疏化
预览效果看起来不错,论文编号 arXiv:2610.05416。
所属事件:腾讯混元联合高校开源 Prism,实现原生 2K 视频音频联合生成(3 条相关)→
「多模态」频道最新
- 5090 本地跑 Minimax H3 出 2K 视频:1984x1120 单段生成耗时 30 分钟 — Kooky-Mode3047 · 2026-10-06
- Wan2GP 更新显存管理:15 秒视频从 10 分钟提速到 5 分钟,首击不再 OOM — orangpelupa · 2026-10-06
- MIRRORSIDE 展示纯 AI 生成「不存在的片场」幕后影像 — StrategyMedium5907 · 2026-10-06
- Qwen-Image 2.1 图像编辑常显「未完成感」,作者晒参数求解 — Suspicious_Aide2697 · 2026-10-06
- 创作者用 Codex 与 GPT-6 Astra 分流重复工作流 — socialwithaayan · 2026-10-06
- Midjourney 风格码 sref 705714994 可生成笔刷质感角色 — michaelrabone · 2026-10-06