复旦腾讯浙大发布 Prism:稀疏注意力训音视频模型提速 2.5 倍
lmoroney · x · 2026-10-07
Prism 由复旦大学、腾讯混元与浙江大学联合推出,是一个原生联合训练视频与音频的 2K 视频模型训练方法,代码、论文和两个预览 checkpoint 均已放出。
- 核心方法:采用稀疏注意力,把 token 序列划分为多个 zone,每个 zone 使用不同的 block 形状——画面变化快或声画强关联的区域用更细的 block,支持 720p、1080p、2K(2560x1440)原生训练。
- 效果:作者报告相比全注意力训练提速 2.5 倍,且质量有所提升。
- 硬件门槛:模型卡写得很实在——720p 推理单张 80GB GPU 即可,1080p 和 2K 需 4 张以上;720p 原生训练至少要 32 张 80GB GPU。
- 上手建议:先租一张 80GB 卡跑 720p 熟悉输出,再考虑更大规模。
所属事件:腾讯混元联合高校开源 Prism 音视频模型(4 条相关)→
「多模态」频道最新
- Feyn 发布 MultiMatte:用文字指定目标抠图,S-measure 达 0.901 — lmoroney · 2026-10-07
- 照片随意放大已成现实:博主实测图像超分效果惊人 — flowersslop · 2026-10-07
- 用 Nano Banana 2.1 渲染虚拟网红,质感惊艳 — AIandDesign · 2026-10-07
- 会说话的枕头:又一则 AI 生成创意短片 — ainsoph00 · 2026-10-07
- 3DGS 追踪升级:120fps 全局快门相机让位姿更新翻倍 — Scobleizer · 2026-10-07
- FastH3 发布官方量化权重,8GB 显存可跑,Ref2VA 将成 V3 重点 — pilkyton · 2026-10-07