PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun
cs.RO
2026-08-21
台大与 NVIDIA 给 Code-as-Policy 加上免训练的质量与刚度估计,再用 Planner 和 Prioritizer 决定探谁、何时停。真机空罐成功率 8/10,交互从穷举的 3.9 次降到 2.5 次。
VLA 会模仿演示完成叠衣服、摆物体,但它们吃的是被动视觉。罐子空不空、牛油果熟不熟,镜头经常看不出来。人会掂一掂、捏一下。强化学习理论上能学到这种信息寻求,样本贵、奖励稀疏,学出来的策略也不好改。
Code-as-Policy 把感知、推理、控制写成可执行模块,比端到端策略好拆。现有 CaP agent 仍然停在被动感知:看见什么就按语义规划,缺一块物理量也不会伸手去测。PhysCaP 要补的就是这一层。没有额外触觉硬件,用机械臂本体感觉把质量和刚度测出来,并且决定测谁、何时停手去执行任务。
系统叠在 CaP-Agent0 上,低层 API 负责抓放和位姿。物体定位用 Molmo2 在图上指点,再经 ZED 2i 深度反投影到三维。物理量靠两个免训练的 PhysX 模块。
质量(getmass):先空爪沿固定轨迹把末端抬高 15 cm 记关节力矩,再抓住物体重复同一动作,差分 Δτ 隔离物体重力。用竖直方向的末端雅可比把力矩换成质量估计,对摆放姿态不那么敏感。
刚度(getstiffness):夹爪小步闭合,用回退测试排除内部摩擦后记下接触位移 d0,继续夹到归一化电机出力 0.50,插值得到形变,映射到 1(极软)到 5(刚性)五档。每物测五次,多数表决。
探索由两个 agent 拆开。Planner 看任务和画面,判断缺什么物理信息,列出候选物体和期望读数,证据够了就停,交给写代码的 agent。Prioritizer 用视觉启发式丢掉不合理动作(杯子太小装不下方块、密封罐几乎不可能是空的),再按优先级排序。把 Planner 和 Prioritizer 合成一个 agent(PhysCaP-joint)会塌成穷举式执行,拆开是有意的。
骨干默认 Gemini 3.1 Pro,所有基线共用同一模型。真机是 AgileX PiPER 七自由度臂,每任务 10 次试验。
纯视觉 CaP 在找蓝方块上 10/10,因为它把三个杯子都掀了(平均交互 3 次)。空罐 2/10、熟牛油果 1/10,镜头看不出隐藏物理量。加上 PhysX 但不做选择,空罐 7/10,平均摸 3.9 个物体、耗时 268 秒;牛油果 9/10、4 次交互、516 秒。完整 PhysCaP 把无效交互压下去:
| 方法 | 空罐成功率 | 交互次数 | 耗时 |
| CaP(纯视觉) | 2/10 | 2.5 | 72 秒 |
| CaP+PhysX | 7/10 | 3.9 | 268 秒 |
| PhysCaP | 8/10 | 2.5 | 239 秒 |
找蓝方块 PhysCaP 9/10,交互 1.33 次、40 秒,低于穷举的 2.7 次、77 秒。牛油果 9/10、2 次交互、300 秒,交互约为穷举的一半。PhysCaP-joint 三任务成功率都掉一截。
质量模块在 13 g 到 963 g 五个校准砝码上各称 20 次,相对质量差稳定。把硬件读数换成真值(oracle),空罐任务到 10/10,剩余失败有一部分来自力矩噪声。刚度用 3D 打印橡皮筋按钮标定,生果对多筋硬挡、熟果对少筋。
LIBERO 仿真空杯任务 50 次:PhysCaP 成功率 78%、交互 1.44;OpenVLA 0%,π0.5 4%,MolmoAct2 23%。这些 VLA 没有「先假设再伸手测」的机制,部分可观测时直接瞎选。
对做操作策略的人,这篇把主动感知从「再训一个探索策略」降成「给 CaP 两个测量 API,再加两个决定测谁的 VLM」。不需要触觉传感器,关节电流和力矩就够区分空罐和满罐。Prioritizer 用的是很浅的常识:密封罐别先称、绿牛油果别先捏。收益来自少做无效交互,测量精度本身并没有碾压基线。
这是工程拼装,不是新的动力学学习。任务被故意限制在 pick-and-place 能解的桌面场景,用来隔离测量模块。能落地的前提是你已经有一套可调的 CaP 栈。
作者自己列了三条:商用 VLM API 延迟和推理不稳定;单目 2D 指点加深度,定位误差直接打到末端;PiPER 通信延迟会让真实轨迹偏离生成代码。
评测更窄。每任务 10 次真机,交互次数和耗时只在成功 episode 上平均,失败的探索成本被丢掉了。单独加上 Planner,找方块和牛油果的成功率相对 CaP+PhysX 还掉了(10/10 到 9/10,9/10 到 8/10),停手策略会误杀。仿真里 CaP+PhysX+Planner 成功率 62%,低于无 Planner 的 74%。空罐 PhysCaP 8/10 对 7/10,在 10 次试验里很薄。物体是标准化商品,工作空间 120×70 cm,推广到杂乱桌面或柔性物体没有证据。