冻结视觉骨干即可训练的机器人策略,消费级 GPU 也能跑
mayfer · x · 2026-07-25
一个机器人策略架构的简化方案:冻结 SOTA 视觉 backbone,把所有 patch token 送进一个小型 transformer policy,再加上 block-causal mask。
- 不需要 VLM,也不需要对 backbone 做 fine-tuning。
- 这套做法可用于 VQ-BeT、Diffusion Policy 等 transformer-based policy。
- 作者还称它可以直接在 消费级 GPU 上训练。
配图展示了整体结构:左侧是多视角观察与目标图像/向量经过视觉编码器后的 observation trunk,右侧是带 frame-wise attention 的 policy 和 action head,用于按时间输出动作。
「具身」频道最新
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11
- AUAR 推移动微型工厂:为每块木板定制生成机器人加工方案 — lukas_m_ziegler · 2026-09-11