李飞飞谈空间智能:AI 只靠「看」不够,还需触觉与模拟
APPSO · wechat · 2026-08-01
文章探讨了 AI 从单纯的图像识别向“空间智能”和具身智能演进的技术路线。
- 视觉的局限与幻觉:多模态模型在未提供图片时,常依靠文字线索“瞎猜”图像内容(即“幻景推理”)。但在物理世界中,精确的位置和距离无法靠语言常识蒙混过关。
- 世界模型的三层架构:WorldLabs 将世界模型拆分为渲染器(生成像素)、模拟器(几何与物理属性)和规划器(决策动作)。仅靠视频生成不代表能在真实物理中干活。
- 仿真到现实的鸿沟:逐际动力、智元等厂商利用仿真平台让机器人低成本试错,但虚拟参数难以覆盖所有现实意外。
- 触觉的不可替代性:李飞飞参与的 T-Rex 机器人研究表明,视觉适合慢速全局判断,而触觉必须以高频运作,在接触瞬间提供即时反馈(如感知滑动、控制力度),从而显著提升精细操作成功率。
「具身」频道最新
- 中国宝武发布320公斤重载人形机器人,专攻钢铁厂高危岗位 — CyberRobooo · 2026-08-01
- 印度初创公司进口英伟达Jetson被海关扣留两周,要求提供无关证书 — DrDatta_AIIMS · 2026-08-01
- 纽约一学区叫停6万美元人形机器人教师助手计划 — nordicinst · 2026-08-01
- 具身智能半年融资超935亿,批量制造的“全球第一”引发刷榜乱象 — 创业邦 · 2026-08-01
- AI眼镜将走向同质化,行业探讨核心护城河 — Scobleizer · 2026-08-01
- 小米人形机器人进厂实习:多任务成功率超 90% — Scobleizer · 2026-08-01