南开DeformSmith分层生成可抓取软体资产,物理真实度0.70对标PhysGen3D的0.46

DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation

Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

cs.RO

2026-09-16

南开与Rightly Robotics提出DeformSmith,从文本或单张图分层生成可仿真、可抓取的软体资产。GPT-6 Astra给的物理真实度0.70、对照PhysGen3D的0.46;机器人抓取成功率从无反馈的40%升到67%。

这篇在解决什么

机器人仿真里缺的不只是看起来像的网格,还有一抓就变形、一放还能稳住的物理。软体更麻烦:几何、材料、接触是耦在一起的,文本或单张图几乎不告诉你杨氏模量和摩擦系数。PhysGen3D、PhysGM 这类方法能从静图推断可交互表示,但那只是初值,不经仿真检验就会在下落和夹持里摊扁、碎掉。

视频法(PhysTwin、DeformMaster)和真机交互法需要已经存在的物体。DeformSmith 的目标更窄也更硬:从文本或一张图自动做出体素软体固体,流体和颗粒不在范围内,并且要能进仿真抓取。

方法

四层递进,后一层默认锁住前一层已经成立的几何和物理模型。

共享的 physics-grounded harness 把 Planner / Designer / Critic 做成 LLM Agent(默认 GPT-5.6 Sol),Prober 跑几何检查或仿真,Orchestrator 按合同执行硬门和修订预算。可编辑字段、参数边界、每指力预算都写在合同里。失败尝试会作为带标签的诊断留下,粒子轨迹可以驱动 Gaussian 回放,不必重跑仿真。

结果

39 个案例:30 个文本、9 个来自 PhysGen3D 公开资产的图像。评判用比 harness 更强的 GPT-6 Astra,0–1 打物理真实、照片感和语义一致;40 人盲测成对偏好,不计平局。下落设定统一:离桌面四分之一物体高度,5 秒,30 fps,两个视角。

方法物理真实照片感语义一致
PhysGen3D0.460.340.80
PhysGM0.390.270.68
PhysX-Omni0.410.320.69
DeformSmith0.700.580.82

物理真实和照片感相对最强基线 PhysGen3D 各高 0.24,语义一致只高 0.02。人对 DeformSmith 的胜率:对 PhysGen3D 为物理 68%、视觉 88%、语义 63%;对 PhysGM 为 73% / 95% / 71%;对 PhysX-Omni 为 75% / 96% / 76%。定性上,对照方法在下落里摊扁、表面撕开或几何残缺,DeformSmith 还能认出海龟、鲸、海豹和橄榄球。

消融:

设置关键指标对照 → 全文
分层 vs 平坦资产交付 / 物理通过83% / 80% → 93% / 87%(仿真次数 13.7 vs 13)
harness vs 一次预测材料达标 / 硬失败40% / 17% → 73% / 7%(平均 14 次构造调用)
有无抓取反馈任务成功 / 材料通过 / 联合成功40% / 67% / 27% → 67% / 83% / 57%

抓取消融只有 6 个资产、每个 5 个留出条件。真机部分只是设想:用生成资产当 DeformMaster / EMPM 的初值,还没有闭环数字。

为什么重要

软体抓取数据很难采。如果生成资产能在仿真里被夹、被运、被放,还带可回放的粒子和接触记录,策略学习至少多了一条合成数据路。分层加硬门的实际含义是:先把质量和接触说清楚,再调材料,避免用错的模量去补错的质量。

视觉和物理观感的提升很清楚;材料参数准不准,这篇没有对真值。语义一致几乎没动,说明「像所求物体」本来就不是最大缺口。

局限与存疑

只覆盖均匀体积材料,复杂层合、布料、流体、颗粒都不在范围内。接触是近似的。物理参数来自文本或图像,作者自己说需要真机验证,文中的真机图只是潜力展示。主指标是 GPT-6 Astra 和 40 人偏好,不是杨氏模量误差,也不是真机抓取成功率。L3 消融样本很小。harness 用 GPT-5.6 Sol、裁判用 GPT-6 Astra,裁判强于生成器,偏好可能偏向「看起来合理」的渲染,而不是本构正确。

术语

原文与代码

相关论文

全部论文解读