RoboFollow 基准揭穿机器人「听懂指令」幻象:9 个 VLA 模型全失守
AutoLab-SJTU · hf · 2026-09-23
上海交大 AutoLab 发布 RoboFollow 诊断基准,指出具身智能体的指令遵循能力远低于成功率数字所暗示的水平。
- 根因:「低场景熵」——当视觉场景只有一个有效任务时,语言变得冗余,策略不看指令也能得高分,造成「听懂了」的错觉。
- 基准设计三原则:高场景熵(每个场景含多条运动学不同的任务分支,迫使模型依赖语言);四级(L0–L3)分层扰动诊断协议;混杂控制(分离意图理解与动作执行得分)。
- 关键发现:评测 9 个 VLA 与 WAM 策略,L0 上表现强并不能可靠迁移到 L1–L3;更强 VLM 骨干、QA 共训练、LangForce、Classifier-Free Guidance 等缓解手段均无法弥合差距。
- 代码与数据集已开源(GitHub / HuggingFace)。
「具身」频道最新
- PixVerse 世界模型支持 WASD 操控,在生成视频里自由行走 — Aiden_Tech_Ai · 2026-09-23
- 拓竹发布首款激光切割机 R1,售价 2499 美元起 — santoshpanda · 2026-09-23
- 烧光 3 次重置再加 Claude x20,玩家用 AI 把双屏设备刷进 Android 17 — PaddleStroke · 2026-09-23
- BlackBerry QNX 搭上 NVIDIA Isaac GR00T N,进军机器人安全系统 — pdamodaran · 2026-09-23
- AI 已破百余道数学难题,通用物理智能却仍未出现 — beffjezos · 2026-09-23
- 阿里发布 Qwen 全栈手机智能方案,荣耀 Magic 9 率先搭载 — AIFlow_ML · 2026-09-23