索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral
mittu1204 · x · 2026-10-03
Sony AI 实习生 Hyun-Bin Oh 主导、Yuhta Takida 领导的 PAVAS 模型被 CVPR 2026 接收为 Oral 报告,源代码现已在 GitHub 公开。
PAVAS 是其前作 MMAudio(CVPR 2025)的演进版,核心改进是在视频转音频(v2a)生成中引入物理感知:通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成音频更贴合视频中的物理互动。仓库包含模型与训练代码(pavas/core)、免训练的物理参数估计器 PPE 及离线预处理流程、训练与评估入口。
论文 PDF 与在线 Demo 均已放出,作者还号召社区将其纳入 CVPR 2027 的 benchmark 对比。
「多模态」频道最新
- Gemini iOS 更新现 GemPix 2.5 Flash 字样,新图像模型或将至 — lyraxana · 2026-10-03
- PotionUI 0.0.14:自托管 AI 生图视频应用接入 OpenRouter 云端模型 — 0roborus_ · 2026-10-03
- 研究员花两周从零训练扩散模型作画,称结果美得让他不安 — pbaylies · 2026-10-03
- 用 Kling 制作的科幻假预告片《Static》引发关注 — SightsFilms · 2026-10-03
- Reddit 网友发布 AI 生成心理恐怖短片《SITCOM》 — Sufficient_Flow_415 · 2026-10-03
- Midjourney 故障风提示词:Glitched Gotham 赛博故障美学 — egeberkina · 2026-10-03