单图重建可编辑3D场景
TheZachMueller · x · 2026-07-20
UC San Diego 和 Lambda 的 CVPR 2026 工作 **PixARMesh**,可以把**单张照片**重建成一个可编辑的 3D 场景。 - 它把整个场景表示成**单一 token 序列**,再用自回归方式生成。 - 不依赖 SDF、occupancy field 或多阶段布局优化。 - 在 3D-FRONT 上,scene-level F-Score 达到 **33.55%**,对比 DepR 的 **25.00%**。 - Chamfer Distance 从 **0.153** 降到 **0.099**。 - 生成的每个物体都是可直接用于创作的 mesh,包含几千个面。 方法上,它将像素对齐的图像特征和全局场景上下文通过 cross-attention 输入自回归 Transformer,在一次前向里逐个 token 预测物体姿态和 mesh。作者也提到它对机器人建图、自动驾驶场景重建、游戏和室内设计都有潜在价值。
「多模态」频道最新
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21