索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral

mittu1204 · x · 2026-10-03

Sony AI 实习生 Hyun-Bin Oh 主导、Yuhta Takida 领导的 PAVAS 模型被 CVPR 2026 接收为 Oral 报告,源代码现已在 GitHub 公开。

PAVAS 是其前作 MMAudio(CVPR 2025)的演进版,核心改进是在视频转音频(v2a)生成中引入物理感知:通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成音频更贴合视频中的物理互动。仓库包含模型与训练代码(pavas/core)、免训练的物理参数估计器 PPE 及离线预处理流程、训练与评估入口。

论文 PDF 与在线 Demo 均已放出,作者还号召社区将其纳入 CVPR 2027 的 benchmark 对比。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →