浙大开源 PhyEdit:单图沿三维轨迹搬物体,盲测偏好率 78%
新智元 · wechat · 2026-08-18
浙大 ReLER 团队开源 PhyEdit(已被 ACM MM 2026 接收),实现单张图片中的物体沿用户指定的三维轨迹移动,支持近远变化、穿过遮挡区域和多物体操作。
核心思路:不让 DiT 编辑器独自「脑补 3D」,而是用冻结的 3D foundation model(默认 Depth-Anything-3)估计深度与相机参数,把 masked pixels 反投影成点云,在三维中移动后投影为粗糙 preview——作为「3D 草稿」交给 Qwen-Image-Edit 融合渲染;训练加入 pixel-level SILog depth loss 直接监督图像深度。
关键结果:
- ManipEval 上 DIoU 65.33、Chamfer 18.93,比 Nano Banana Pro 分别高 5.36、低 6.40;匿名盲测整体偏好率 78.0%。
- 换用 DA2、MoGe、VGGT、Pi3X 等不同 3D backbone 仍保持正向几何增益,说明收益不依赖特定深度模型。
- 同时做三维移动+外观编辑的综合成功率 87.5%,仅比纯编辑的 Qwen-Image-Edit 低 1.3 个百分点,但三维 Chamfer(20.97 vs 46.31)大幅领先。
- 开源 RealManip-40K 数据集:41,154 对真实源/目标图,含深度、mask 与三维坐标,管线用 camera token 聚类过滤机位移动。
局限:不做力、碰撞等物理仿真;透明反光物体、极端近景与深度/分割错误场景仍会失败。项目提供完整 GUI,可在点云中调节平移旋转并实时预览。
「多模态」频道最新
- 西湖大学等提出三体散射算法,单步生成图像达 SOTA — jiqizhixin · 2026-08-18
- 实战:用 Midjourney 与 GPT IMG 2 生成角色场景 — aziz4ai · 2026-08-18
- Karate Warrior:Midjourney 与 GPT 图像生成视频 — aziz4ai · 2026-08-18
- MOSS-VL:支持实时交互的开源视觉语言模型 — OpenMOSS-Team · 2026-08-18
- 完整 Prompt 分享:玻璃与铜丝之手下的裁缝日常 — tisch_eins · 2026-08-18
- MiniMax H3 上 ComfyUI:一键模板落地,附 4090 实测速度 — TheLocalLab · 2026-08-18