具身智能盲区:9款VLM懂修车但不会主动发现问题
rohanpaul_ai · x · 2026-08-14
一项针对具身智能的研究揭示了一个微妙的失败模式:模型可能具备相关知识,但无法在需要时主动调用。
研究人员录制了仅改变一个变量的成对物理任务视频(如专家刹车维修),为模型提供了普通互联网视频 rarely 具备的受控干预测试。他们对 9 个视觉语言模型(VLM)进行了测试,发现当明确指出变量变化时,模型能正确推理;但如果保持沉默,模型往往无法自主发现这一变化。
这种差距在真实部署中至关重要,因为系统必须在推理开始前就正确分配注意力,而现实世界不会总是抛出界定清晰的问题。
「具身」频道最新
- Matic 家用机器人发布 Cues 功能:支持语音手势交互 — chris_j_paxton · 2026-08-14
- AMD 赠送 Ryzen AI Halo 专为 LLM 优化 — JosephJacks_ · 2026-08-14
- 英特尔 RealSense 推出 Perception Studio,强化机器人感知 — chrismatthieu · 2026-08-14
- 观点:人形机器人被高估,专用垂直机器人更具商业价值 — AnneliesGamble · 2026-08-14
- 具身智能新研究:机器人基础模型在链式任务中常“知而不行” — rohanpaul_ai · 2026-08-14
- Matic 扫地机器人发布 Cues 功能,支持 70+ 语言与手势交互 — jokrvivek · 2026-08-14