VLA模型懂指令却做不好:Colosseum V2推出机器人泛化基准
_jessethomason_ · x · 2026-08-06
南加州大学等团队提出 Colosseum V2 基准,专门测试视觉-语言-动作(VLA)模型在机器人操作中的泛化能力。
- 核心洞察:当前的 VLA 模型虽然具备强大的零样本感知与语言理解能力,但在面对分布偏移时,往往无法将高层语义理解转化为稳健的物理操作,导致任务失败。
- 基准规模:基于 ManiSkill 构建了大规模并行模拟评测,包含 28 个任务、13 个任务类别,覆盖两种不同的机器人形态。
- 评测发现:对 ACT 和 Pi0.5 等前沿方法测试表明,它们在基础性能和泛化能力上均存在局限。此外,模拟指标与真实世界指标间存在强相关性,证明了该基准的生态有效性。
「具身」频道最新
- Path Robotics签6亿美元造船合同,具身智能商业化已启动 — Rewkang · 2026-08-07
- Physical AI加速落地:Path Robotics斩获6亿美元造船大单 — Rewkang · 2026-08-07
- Aktoria Robotics提供低成本机器人远程操作服务 — ycombinator · 2026-08-06
- 前 Neuralink 联创宣布新创业:打造人们喜爱的家用机器人 — neurosp1ke · 2026-08-06
- IROS 2026 人机对话研讨会征稿延期至 8 月 17 日 — _jessethomason_ · 2026-08-06
- 欧洲大学生组建机器人联盟,8国2500人入局 — MarvinTBaumann · 2026-08-06