CVPR2025 论文用相机自运动,让视频无标注学会三维听声辨位
量子位 · wechat · 2026-07-26
来自清华大学和密歇根大学的团队在 CVPR 2025 Highlight 上提出了一种新方法:不用 360 度麦克风阵列,也不用人工标注,直接利用无标注互联网视频学习三维空间音频感知。
核心思路
- 传统空间音频方法要么依赖昂贵设备,要么依赖人工标注,扩展性很差。
- 这项工作把相机自运动(ego-motion)当作“免费监督信号”:相机在视频中转动、平移时,声源相对位置也会变化,模型据此学习声音方向与空间位移关系。
数据与方法
- 团队构建了两个数据集:iPhoneFountain 和 iPhoneMusicDataset。
- 训练时输入相邻时间点的音频片段和对应视频帧。
- 先从视觉帧估计相机旋转/平移方向,再把这些运动标签编码成简单的左右、前后等监督目标,联合训练空间声源定位模块。
结果与结论
- 模型在自建数据集和公开 Fountain 基准上都取得了有竞争力的表现。
- 消融实验显示,声源距离对性能影响很大:距离越远,定位越容易退化。
- 这项工作的意义在于把空间音频从实验室设备和人工标注中解放出来,为机器人、AR/VR 和多模态学习提供了可扩展的数据路线。
「具身」频道最新
- AI 眼镜开始支持 3DOF 空间工作区演示 — Scobleizer · 2026-07-26
- REK Tokyo 称日本首个机器人秀已成功成立 — cixliv · 2026-07-26
- MiniCPM-Robot 以上下文记忆和本地追踪引关注 — aliscodes · 2026-07-26
- 马斯克 Optimus 被包装成酒店清洁模式演示 — 4KTV · 2026-07-26
- Instagram 封禁 Meta 眼镜偷拍视频与骚扰内容 — Polymarket · 2026-07-26
- Sunday Robotics 说机器人已准备进入真实家庭测试 — mon__lim · 2026-07-26