冻结视觉骨干即可训练的机器人策略,消费级 GPU 也能跑
mayfer · x · 2026-07-25
一个机器人策略架构的简化方案:冻结 SOTA 视觉 backbone,把所有 patch token 送进一个小型 transformer policy,再加上 block-causal mask。
- 不需要 VLM,也不需要对 backbone 做 fine-tuning。
- 这套做法可用于 VQ-BeT、Diffusion Policy 等 transformer-based policy。
- 作者还称它可以直接在 消费级 GPU 上训练。
配图展示了整体结构:左侧是多视角观察与目标图像/向量经过视觉编码器后的 observation trunk,右侧是带 frame-wise attention 的 policy 和 action head,用于按时间输出动作。
「具身」频道最新
- Mark Cuban 认为人形机器人 5 到 10 年内会失败 — rohanpaul_ai · 2026-07-25
- Python 视觉伺服演示在两个框架上跑通闭环 — wightmanr · 2026-07-25
- 小鹏人形机器人试产,Anthropic 也在推进自研芯片 — 创业邦 · 2026-07-25
- 带键盘的 AI 盒子原型机,指向新移动终端形态 — dee_hw · 2026-07-25
- DroneBench 显示前沿模型已能追人超人类,但仍常撞墙 — No_Call3116 · 2026-07-25
- 中国开始推出主打缓解孤独的人形陪伴机器人 — ArtificialOther · 2026-07-25