BIND 动作头绑定 2D 图像特征,机器人策略更省数据更抗视角变化
yuewang314 · x · 2026-10-03
研究者提出机器人学习中的一个悖论:图像编码器的特征空间上很聪明——嵌入语义、几何信息且多视角一致;但构建在其上的机器人策略却「空间上很笨」——学会简单的抓取放置需要数百条演示,相机稍微一动就失效。
为弥合这一差距,团队提出 BIND,一种新的动作头(action head):将每个候选机器人动作绑定到其在 2D 图像上的投影特征,相当于告诉网络「选择这个动作会把末端执行器(EEF)移动到图像的这个位置」。
效果:策略数据效率大幅提升,对分布外(OOD)视角和物体位置更鲁棒;仅用 RGB 输入、无需 3D 传感器,即可输出密集的 EEF 轨迹。
「具身」频道最新
- YC 孵化 Applied Electrodynamics:用无线电波穿墙成像,实时生成 3D 室内模型 — ycombinator · 2026-10-03
- Runway 世界模型转战机器人:Praxis-1 只需几分钟演示数据 — c_valenzuelab · 2026-10-03
- 四指胜五指?机器人手设计正抛弃拟人执念,成本可降五分之一 — Scobleizer · 2026-10-03
- 开发者切身体验:从传统机械臂到 VLA 模型,sim2real 入门全记录 — chrisalbon · 2026-10-03
- 连坐 50 次 Cybercab 后,whurley 力挺特斯拉无人出租车 — whurley · 2026-10-03
- Apple M5 Ultra 256GB 上下文实测:Qwen 量化模型 prefill 速度亮眼 — antirez · 2026-10-03