Berkeley 等发布 VIGA:用 Blender 闭环推理把图片重建为可编辑 3D 场景
Michael_J_Black · x · 2026-09-12
UC Berkeley、CMU、Max Planck 等机构在 ECCV 展示 VIGA(Vision-as-Inverse-Graphics Agent),一个通过交替多模态推理把输入图像重建为可编辑场景程序的 agent。要点:
- 核心机制是 analysis-by-synthesis 闭环:生成器提出可执行的 Blender 修改代码,验证器观察更新后的场景再给反馈迭代,作者称为 "vibe code" 场景、物理与交互。
- 资产既可用基础几何体从零搭建,也可接入 Meshy、SAM-3D 等现成 3D 生成工具获得更高质量资产。
- 演示包括重建场景后扔球砸倒物体、砸碎镜子、模拟地震等物理交互。
- 配套论文、代码与 benchmark 已开源,作者 Michael Black(Max Planck)邀请 ECCV 与会者看 Poster #130。
「多模态」频道最新
- 用 GPT-6 Astra 半自动复刻名古屋站,一句「生成周围」搞定全城 — gabrielchua · 2026-09-12
- Stable Audio 实现按文本分数条件生成,作者晒实时运行演示 — matdryhurst · 2026-09-12
- ComfyUI-MiniMaxH3-CLSS 大更新:分场景参考、音频重组与流式潜在放大 — nazgut · 2026-09-12
- 胶片摄影风提示词示范:Midjourney 复刻柯达 Tri-X 质感 — michaelrabone · 2026-09-12
- Lovart 实测:GPT-Image 2.5 像素画生成效果出色 — gabrielchua · 2026-09-12
- 用 Astra、Blender 与 Unity 造出客厅里的 3D 未来 — Scobleizer · 2026-09-12