AMP 提出把机器人操控化为像素分类,绕开动作空间爆炸

jiqizhixin · x · 2026-09-18

LLM 验证了交叉熵预测在 1D 序列上的可扩展性,但机器人动作本质是高维的:每个时间步 6–7 个自由度,即使粗粒度离散化(每维 10 档)也会产生约 100 万种组合动作,更细的离散化或更长时域会让空间彻底爆炸,因此 LLM 的交叉熵范式无法直接套用到机器人学习。

Action Map Policy(AMP)提出新的机器人操控学习范式:把高精度 3D 闭环操控重新表述为图像空间中的像素分类问题。模型不再在组合爆炸的动作 token 空间里预测,而是在一张 action map(把 3D 运动编码为空间位置的 2D 表示)上分类“在哪行动”,从而把交叉熵预测范式从语言迁移到机器人领域,同时避开维度灾难。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →