DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation
Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun
cs.RO
2026-09-16
南开与Rightly Robotics提出DeformSmith,从文本或单张图分层生成可仿真、可抓取的软体资产。GPT-6 Astra给的物理真实度0.70、对照PhysGen3D的0.46;机器人抓取成功率从无反馈的40%升到67%。
机器人仿真里缺的不只是看起来像的网格,还有一抓就变形、一放还能稳住的物理。软体更麻烦:几何、材料、接触是耦在一起的,文本或单张图几乎不告诉你杨氏模量和摩擦系数。PhysGen3D、PhysGM 这类方法能从静图推断可交互表示,但那只是初值,不经仿真检验就会在下落和夹持里摊扁、碎掉。
视频法(PhysTwin、DeformMaster)和真机交互法需要已经存在的物体。DeformSmith 的目标更窄也更硬:从文本或一张图自动做出体素软体固体,流体和颗粒不在范围内,并且要能进仿真抓取。
四层递进,后一层默认锁住前一层已经成立的几何和物理模型。
共享的 physics-grounded harness 把 Planner / Designer / Critic 做成 LLM Agent(默认 GPT-5.6 Sol),Prober 跑几何检查或仿真,Orchestrator 按合同执行硬门和修订预算。可编辑字段、参数边界、每指力预算都写在合同里。失败尝试会作为带标签的诊断留下,粒子轨迹可以驱动 Gaussian 回放,不必重跑仿真。
39 个案例:30 个文本、9 个来自 PhysGen3D 公开资产的图像。评判用比 harness 更强的 GPT-6 Astra,0–1 打物理真实、照片感和语义一致;40 人盲测成对偏好,不计平局。下落设定统一:离桌面四分之一物体高度,5 秒,30 fps,两个视角。
| 方法 | 物理真实 | 照片感 | 语义一致 |
| PhysGen3D | 0.46 | 0.34 | 0.80 |
| PhysGM | 0.39 | 0.27 | 0.68 |
| PhysX-Omni | 0.41 | 0.32 | 0.69 |
| DeformSmith | 0.70 | 0.58 | 0.82 |
物理真实和照片感相对最强基线 PhysGen3D 各高 0.24,语义一致只高 0.02。人对 DeformSmith 的胜率:对 PhysGen3D 为物理 68%、视觉 88%、语义 63%;对 PhysGM 为 73% / 95% / 71%;对 PhysX-Omni 为 75% / 96% / 76%。定性上,对照方法在下落里摊扁、表面撕开或几何残缺,DeformSmith 还能认出海龟、鲸、海豹和橄榄球。
消融:
| 设置 | 关键指标 | 对照 → 全文 |
| 分层 vs 平坦 | 资产交付 / 物理通过 | 83% / 80% → 93% / 87%(仿真次数 13.7 vs 13) |
| harness vs 一次预测 | 材料达标 / 硬失败 | 40% / 17% → 73% / 7%(平均 14 次构造调用) |
| 有无抓取反馈 | 任务成功 / 材料通过 / 联合成功 | 40% / 67% / 27% → 67% / 83% / 57% |
抓取消融只有 6 个资产、每个 5 个留出条件。真机部分只是设想:用生成资产当 DeformMaster / EMPM 的初值,还没有闭环数字。
软体抓取数据很难采。如果生成资产能在仿真里被夹、被运、被放,还带可回放的粒子和接触记录,策略学习至少多了一条合成数据路。分层加硬门的实际含义是:先把质量和接触说清楚,再调材料,避免用错的模量去补错的质量。
视觉和物理观感的提升很清楚;材料参数准不准,这篇没有对真值。语义一致几乎没动,说明「像所求物体」本来就不是最大缺口。
只覆盖均匀体积材料,复杂层合、布料、流体、颗粒都不在范围内。接触是近似的。物理参数来自文本或图像,作者自己说需要真机验证,文中的真机图只是潜力展示。主指标是 GPT-6 Astra 和 40 人偏好,不是杨氏模量误差,也不是真机抓取成功率。L3 消融样本很小。harness 用 GPT-5.6 Sol、裁判用 GPT-6 Astra,裁判强于生成器,偏好可能偏向「看起来合理」的渲染,而不是本构正确。