ROMA:7B 模型让机器人主动摸、掂、摇来理解物体

机器之心 · wechat · 2026-10-10

人大 GeWu-Lab、智源研究院等机构发布 ROMA(Real-World Object-Centric Multi-Sensory Active Perception),研究机器人如何像人一样通过主动交互补全物理理解:摇一摇、掂一掂来判断物体属性,而非被动接收感官信息。

工作包含三部分:①ROMI-2K 数据集,覆盖近 2000 个日常物体与内含物组合、6 种基础物理交互,同步采集视/听/触/力四模态;②ROMABench,2100 个场景级主动感知任务,含单链、多链和意图驱动三类推理;③ROMA-7B 模型(基于 Qwen2.5-Omni 微调),主动决定抓哪个物体、做什么交互、关注什么模态、何时停止,形成「推理-交互-反馈」闭环。

在 ROMABench 上,ROMA-7B 以 7B 规模取得 72.9% 成功率,整体与 GPT-6 Astra 持平,明显超过 GPT-5.4 和 Gemini 3.5 Flash;在需要连续多模态交互的任务上甚至更强。真实世界 132 道开放问答中成功率 61.4%,能力可迁移到真实场景。数据集与代码已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →