EgoTSR:让VLM看懂机器人任务进展,破解时序偏差

机器之心 · wechat · 2026-07-04

浙江大学、天津大学、青岛大学、上海交通大学、新加坡国立大学等五所高校团队提出 EgoTSR,针对视觉语言模型(VLM)在机器人任务推理中的「时序偏差」问题:由于大量机器人视频按正常时间顺序记录,模型会形成「后出现的画面更接近任务完成」的捷径,无法识别抓取失败、状态回退等真实情况。

研究从第一人称机器人视角出发,让 VLM 学会判断任务状态并扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计三阶段课程学习:先用约 1500 万条 CoT 数据建立显式推理,再用约 1600 万条 Tag 数据内化为快速判断,最后用约 1500 万条 LongTag 数据扩展到长程任务;同时引入子任务规划器(SubtaskPlanner),将高层任务拆解为有序原子子任务,使模型沿任务链判断进度。

研究用一个简单方法暴露顺序依赖:把同一对图像按正反顺序分别输入。实验显示问题严重——以部分长任务评测为例,InternVL-8B 在正向输入下准确率接近 99%,交换图像顺序后骤降至约 2%,说明模型并非真正分析物体状态,而是依据图片位置猜测答案。代码已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →