北大团队发布 OmniEcho:让具身智能听懂空间声音的基准与模型
PKU-VaLuE-Lab · hf · 2026-09-25
PKU-VaLuE-Lab 发布 OmniEchoBench 与 OmniEcho 模型,探索具身智能体的空间音频理解。
- 基准:覆盖 197 个真实空间音视频场景、6 项任务、2,972 组问答,以及来自 30 个真实环境的 900 条导航样本,音频采用一阶 Ambisonics(FOA)格式
- 训练管线:开发可控空间音频渲染管线,保证声源、视觉观察与智能体轨迹之间的几何一致性
- 模型:OmniEcho 引入 FOA 空间编码器与预训练语义音频通路,在空间音视频感知上达到 SOTA;声音引导导航性能接近传统视觉语言导航
- 开放问题:细粒度空间定位与距离估计仍是主要挑战
「具身」频道最新
- HRI 2027 新设存档级工业白论文赛道,征集机器人落地实践 — petitegeek · 2026-09-25
- Google 员工设想:用智能眼镜实时看见并「拍肩指挥」AI Agent — jason_mayes · 2026-09-25
- 用 iPhone LiDAR 做攀岩 3D 分析:开源视觉工具链解读 — dosco · 2026-09-25
- Menlo 开源人形机器人 Asimov 1 运动控制策略与训练代码 — freelerobot · 2026-09-25
- IROS 2026 人机对话研讨会下周举行,MIT 与 NVIDIA 讲者云集 — dhadfieldmenell · 2026-09-25
- AI 眼镜上半年出货量暴涨 263%,智元第 2 万台机器人交付 — 创业邦 · 2026-09-25