作者称纯 VLA 未必需要强长程规划,VLM 已能补位

m_wulfmeier · x · 2026-08-04

作者认为,纯 VLA(Vision-Language-Action)模型未必需要在长时程规划上做到很强,因为这类能力可以由 VLM(Vision-Language Model)来补位,而且 VLM 的提升通常更容易。

他还拿 OpenAI 的魔方案例举例,认为长时程问题其实已经有了一个相当强的解法;接下来更值得关注的,可能不是让 VLA 单独承担全部规划,而是继续增强 VLM,并把它放进更合适的系统里。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →