ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware
Shuai Zhou, Kaisheng Pang, Wenxuan Song, Wenjie Zhang, Xinhu Zheng, Haoang Li
cs.RO, cs.LG
2026-09-16
CMU 与港科广给 π0.5 加历史帧和相机位姿监督,用 1000 小时人机数据中期训练,五项需主动观察的真机任务平均成功率从 30% 升到 70%。
固定机位的 VLA 在柜子里、背包里、桌底下会看不见目标。人会低头、探头、把视线挪到任务相关处。现有 VLA 大多既不显式估计当前相机位姿,也不把「下一步该怎么转头」和手臂动作放在同一个策略里。
先前的主动感知工作把相机和手臂拆开训(SAPAVE),或用大约 200 小时自我中心数据做预训练(EgoMI)。缺三件事:模型侧没有位姿接地的跨视角关联;数据侧没有把人的转头当监督信号用到 1000 小时量级;硬件侧大多还在静止桌面上,到移动操作还有缺口。
三件套一起做。
模型。骨干是 π0.5(PaliGemma VLM 加 flow matching 动作专家)。正面相机除当前帧外再取 t−48、t−32、t−16 三帧,每帧视觉 token 后面跟一个可学习相机 token。token 的隐状态经线性层进 VGGT 风格的 9 维相机头,预测平移、四元数朝向和水平/垂直视场,训练时用分量 ℓ1,推理时去掉这个头。历史块做 block-causal attention,手腕、语言和动作 token 能看到全部有效历史。动作同时含双臂末端和主动相机。
数据。从预训练 π0.5 出发先做人机 1:1 混合中期训练。人的数据来自 EgoLive 和 EgoVerse 的室内家务片段,机器人数据来自 AgiBot World、RoboCOIN 和自家平台,合计超过 1000 小时,号称比先前主动感知工作大约 5 倍。人的头和腕轨迹变换到窗口内最早有效观测的相机系。然后再用任务遥操作数据做后训练,这一阶段只留 flow matching 和相机损失。
硬件。AMP 改自 AgileX Cobot-Magic:差速底盘、左右两条 Piper 臂做双臂操作,中间再加一条臂扛主动相机。一个人用 Meta Quest 2 头显加双手柄同时控视角、双臂和底盘。状态和动作都写在随底盘走的机器人坐标系里,共 23 维。每类任务后训练 150 条示教。
五项真机任务,每项 20 次 rollout,成功必须跑完所有阶段。对照是同一份后训练数据上直接微调的 π0.5。近期主动感知 VLA 没公开完整配方,所以没做直接对比。
| 任务 | π0.5 成功率 | ActiveScale |
| 背包取瓶 | 40% | 75% |
| 开抽屉取物 | 35% | 55% |
| 桌下取物 | 10% | 85% |
| 架子取菜入锅 | 15% | 50% |
| 按指令装箱 | 50% | 85% |
| 平均 | 30.0% | 70.0% |
平均任务进度从 41.6% 到 78.4%。桌下任务的反差最大:π0.5 经常不启动抓取,ActiveScale 会先低头找到目标。消融上,去掉中期训练平均成功率从 70% 掉到 62%;只加历史不加相机 token,背包任务会比单帧基线更差,加上位姿监督后五类任务都拉回来。RTX 4090 上 50 步动作块吞吐 264.5 Hz,异步执行能跟上 30 Hz 控制。移动操作只给了单人遥操作演示,没有学成策略的成功率。
主动感知被拆成三件事:模型要把不同视角的观测钉在同一场景上,数据要有足够的转头监督,硬件要让一个人采得到协同示教。相机 token 这招很轻,不把点云或深度塞进 VLA。对已经在用 π0.5 的团队,这是可复用的中期训练配方。代价也清楚:1000 小时中训和定制三臂平台不是随手能仿的。
没有独立局限节。对照只有 π0.5,主动感知同行因无公开权重被跳过,SOTA 声明的参照面偏窄。每项 20 次试验、150 条后训练示教,样本很紧。相机头只在训练期存在,推理时跨视角关联全靠 token 表征,论文没有单独测这个表征还在不在。移动主动感知被明确留作未来工作。人的数据经过室内家务筛选,迁移边界取决于这段筛选。分任务成功率读自柱状图,装箱一项上中训增益在消融图里也不稳定。