冻结视觉骨干即可训练的机器人策略,消费级 GPU 也能跑

mayfer · x · 2026-07-25

一个机器人策略架构的简化方案:冻结 SOTA 视觉 backbone,把所有 patch token 送进一个小型 transformer policy,再加上 block-causal mask。

配图展示了整体结构:左侧是多视角观察与目标图像/向量经过视觉编码器后的 observation trunk,右侧是带 frame-wise attention 的 policy 和 action head,用于按时间输出动作。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →