牛津 VGG 发布 SynCity 3000:一次生成全局连贯的大规模 3D 场景
rsasaki0109 · x · 2026-10-02
牛津大学 Visual Geometry Group(Paul Engstler、Iro Laina、Christian Rupprecht、Andrea Vedaldi)发布 3D 场景生成新框架 SynCity 3000,是 SynCity 的后续工作。
- 核心思路:将图像转 3D 生成器改造成可用的"卷积算子",通过新提出的合成数据引擎微调模型,再对由文本 prompt 生成的整个场景 dimetric 图施加卷积式生成,从而产出任意大小与复杂度的 3D 场景。
- 对比前代:SynCity 逐 tile 生成会留下明显网格痕迹;SynCity 3000 在扩散的每一步对重叠窗口做卷积式生成,实现有机、全局连贯的场景结构,并支持在场景内精确放置物体(不再局限于刚性网格)。
- 评测结果:布局控制偏好 100% 胜过 SynCity,生成场景质量 63% 偏好胜 SynCity,59.3% 偏好胜同期工作 3DTown。
- 提供论文(arXiv)、PDF、GitHub 与 World Designer 演示。
「多模态」频道最新
- PEARL 发布首个用户历史驱动的个性化图像生成基准,指标平均提升 15% — Bo Ni · 2026-10-02
- 首篇系统综述:视频-音频联合生成与编辑统一形式化,9 类 28 种编辑 — Abhinav Sharma · 2026-10-02
- 用 Codex + Higgsfield MCP 制作 NCT 127 完整 AI MV — leesysysysy · 2026-10-02
- 实测:用 Nano Banana 做图像编辑,效果直接看图 — tkasasagi · 2026-10-02
- 博主实测:Opus 5.5 剪视频很强,但无需求硬用产出多垃圾 — AlchainHust · 2026-10-02
- Reddit 用户用 AI 做出以假乱真的概念车动态视频 — Vashukanni · 2026-10-02