斯坦福论文剖析 VLA 模型在复杂操控任务中的失效机制

StanfordAILab · x · 2026-08-05

斯坦福 AI 实验室分享了最新论文,探讨了视觉-语言-动作(VLA)模型在处理接触密集型操控任务(contact-rich manipulation)时依然面临困难的原因。

研究旨在揭示这类模型在复杂物理交互场景下何时以及为何会失败,并提出了相应的修复与改进方案。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →