Jitendra Malik:别把 VLM 和世界模型混为一谈
JitendraMalikCV · x · 2026-08-24
伯克利教授 Jitendra Malik 呼吁机器人学界保持术语精确,不要混用 VLM、VLA、世界模型(World Models)。他指出:VLM 源自 LLM 的多模态扩展(如 VQA 训练),捕捉的是图像背后的静态语义,不含动态;而世界模型本质是动力学模型,可追溯到 1960 年代的控制论(Bellman、Kalman),用于回答「在状态 s 下执行什么动作 a 能到 s'」,经典控制中由物理建模先验写出,如今则从视频、机器人轨迹等时序数据中学习为神经网络,但概念不变。两者不应混同。
「具身」频道最新
- 预测今年内实现 AGI 与 ASI,含自动驾驶与人形机器人 — davidpattersonx · 2026-08-24
- 人形机器人量产元年,恰逢人类生育率低于更替水平 — Dr_Singularity · 2026-08-24
- Galbot 人形机器人自主完成百次网球对打 — Distinct-Question-16 · 2026-08-24
- 可骑乘机器马Qiji X1亮相:自研关节电机峰值扭矩1400Nm — tristanbob · 2026-08-24
- 内存专家预测:ANN 存储将广泛用于边缘 IoT 与人形机器人 — BenBajarin · 2026-08-24
- 花 266 美元跑 4 个本地模型,彻底解锁亚马逊平板 — yogthos · 2026-08-23