REALM 生成反应式听者面部动作,已部署到 Ameca 人形机器人
MacquarieUni · hf · 2026-09-29
麦克夸里大学等发布 REALM(Reactive Embodied Audio-driven Listening Model),面向具身对话 AI 中的“反应式倾听者”生成任务——根据说话者音频实时生成倾听者面部动作。
两大建模挑战:既要跟随说话者线索的时间(听者反应常有延迟),又要保持与自身运动历史的连续性;同时捕捉眨眼、短暂表情等局部随机事件与整体运动轨迹。
方法:coarse-to-fine 框架——Reactive Gated Speaker-Listener Fusion 模块用以延迟为中心的注意力先验和自适应门控融合听者运动历史与说话者音频;粗糙解码器先预测基础运动轨迹,再由音频条件化的随机残差在表情子空间做细化。
结果:在 ViCo 和 L2L 上多项运动质量指标超过基线;并完成了 Ameca 人形机器人上的实际部署与感知用户研究。代码与 Demo 已开源。
「具身」频道最新
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Uniformation S10 树脂 3D 打印机器人:打印、清洗、烘干全自动 — philfung · 2026-09-29
- 韩国造磁足蜘蛛焊接机器人,可爬壁登顶负重 30 公斤进船厂 — MickeySteamboat · 2026-09-29
- 「终结者」式机器人竞技场 REK:人机对决成全新极限运动 — cixliv · 2026-09-29
- AIgirl 演示做晚饭,人形机器人家务能力再进一步 — miamiamorph · 2026-09-29
- 把机器人任务表示为代码:HexaAnything 用编码 agent 模式进化物理智能 — Hongcheng Gao · 2026-09-29