ROMA:7B 模型让机器人主动摸、掂、摇来理解物体
机器之心 · wechat · 2026-10-10
人大 GeWu-Lab、智源研究院等机构发布 ROMA(Real-World Object-Centric Multi-Sensory Active Perception),研究机器人如何像人一样通过主动交互补全物理理解:摇一摇、掂一掂来判断物体属性,而非被动接收感官信息。
工作包含三部分:①ROMI-2K 数据集,覆盖近 2000 个日常物体与内含物组合、6 种基础物理交互,同步采集视/听/触/力四模态;②ROMABench,2100 个场景级主动感知任务,含单链、多链和意图驱动三类推理;③ROMA-7B 模型(基于 Qwen2.5-Omni 微调),主动决定抓哪个物体、做什么交互、关注什么模态、何时停止,形成「推理-交互-反馈」闭环。
在 ROMABench 上,ROMA-7B 以 7B 规模取得 72.9% 成功率,整体与 GPT-6 Astra 持平,明显超过 GPT-5.4 和 Gemini 3.5 Flash;在需要连续多模态交互的任务上甚至更强。真实世界 132 道开放问答中成功率 61.4%,能力可迁移到真实场景。数据集与代码已开源。
「具身」频道最新
- 隐性六年出山:Atomic Machines 发布 AI 原生「物质编译器」 — DeryaTR_ · 2026-10-10
- Datawhale 具身智能教程破 4k 星:从零手搓 VLA 到真机部署 — philfung · 2026-10-10
- Carmack 亲测 Waymo 与 Zoox:上下车点太少成最大痛点 — ID_AA_Carmack · 2026-10-10
- Archon Robotics 发布全身智能框架,人形机器人逼近真实场景部署 — jiqizhixin · 2026-10-10
- 成立半年首发实机:源策人形机器人会搬踏台登高取物 — 机器之心 · 2026-10-10
- RT 系列联合作者 Ted Xiao 将在 Humanoid Hub 大会讲后 AGI 的物理世界 — xiao_ted · 2026-10-10