REALM 生成反应式听者面部动作,已部署到 Ameca 人形机器人

MacquarieUni · hf · 2026-09-29

麦克夸里大学等发布 REALM(Reactive Embodied Audio-driven Listening Model),面向具身对话 AI 中的“反应式倾听者”生成任务——根据说话者音频实时生成倾听者面部动作。

两大建模挑战:既要跟随说话者线索的时间(听者反应常有延迟),又要保持与自身运动历史的连续性;同时捕捉眨眼、短暂表情等局部随机事件与整体运动轨迹。

方法:coarse-to-fine 框架——Reactive Gated Speaker-Listener Fusion 模块用以延迟为中心的注意力先验和自适应门控融合听者运动历史与说话者音频;粗糙解码器先预测基础运动轨迹,再由音频条件化的随机残差在表情子空间做细化。

结果:在 ViCo 和 L2L 上多项运动质量指标超过基线;并完成了 Ameca 人形机器人上的实际部署与感知用户研究。代码与 Demo 已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →