具身智能盲区:9款VLM懂修车但不会主动发现问题

rohanpaul_ai · x · 2026-08-14

一项针对具身智能的研究揭示了一个微妙的失败模式:模型可能具备相关知识,但无法在需要时主动调用。

研究人员录制了仅改变一个变量的成对物理任务视频(如专家刹车维修),为模型提供了普通互联网视频 rarely 具备的受控干预测试。他们对 9 个视觉语言模型(VLM)进行了测试,发现当明确指出变量变化时,模型能正确推理;但如果保持沉默,模型往往无法自主发现这一变化。

这种差距在真实部署中至关重要,因为系统必须在推理开始前就正确分配注意力,而现实世界不会总是抛出界定清晰的问题。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →