EgoTSR:让VLM看懂机器人任务进展,破解时序偏差
机器之心 · wechat · 2026-07-04
浙江大学、天津大学、青岛大学、上海交通大学、新加坡国立大学等五所高校团队提出 EgoTSR,针对视觉语言模型(VLM)在机器人任务推理中的「时序偏差」问题:由于大量机器人视频按正常时间顺序记录,模型会形成「后出现的画面更接近任务完成」的捷径,无法识别抓取失败、状态回退等真实情况。
研究从第一人称机器人视角出发,让 VLM 学会判断任务状态并扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计三阶段课程学习:先用约 1500 万条 CoT 数据建立显式推理,再用约 1600 万条 Tag 数据内化为快速判断,最后用约 1500 万条 LongTag 数据扩展到长程任务;同时引入子任务规划器(SubtaskPlanner),将高层任务拆解为有序原子子任务,使模型沿任务链判断进度。
研究用一个简单方法暴露顺序依赖:把同一对图像按正反顺序分别输入。实验显示问题严重——以部分长任务评测为例,InternVL-8B 在正向输入下准确率接近 99%,交换图像顺序后骤降至约 2%,说明模型并非真正分析物体状态,而是依据图片位置猜测答案。代码已开源。
「具身」频道最新
- 纽约高中拟引入人形机器人遭教师反对 — nordicinst · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- 机器人走到冰箱前拿出一瓶啤酒 — Darpinian · 2026-07-27
- 研究者用针织结构复现数字电路 — mtizard · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27