单图重建可编辑3D场景
TheZachMueller · x · 2026-07-20
UC San Diego 和 Lambda 的 CVPR 2026 工作 PixARMesh,可以把单张照片重建成一个可编辑的 3D 场景。
- 它把整个场景表示成单一 token 序列,再用自回归方式生成。
- 不依赖 SDF、occupancy field 或多阶段布局优化。
- 在 3D-FRONT 上,scene-level F-Score 达到 33.55%,对比 DepR 的 25.00%。
- Chamfer Distance 从 0.153 降到 0.099。
- 生成的每个物体都是可直接用于创作的 mesh,包含几千个面。
方法上,它将像素对齐的图像特征和全局场景上下文通过 cross-attention 输入自回归 Transformer,在一次前向里逐个 token 预测物体姿态和 mesh。作者也提到它对机器人建图、自动驾驶场景重建、游戏和室内设计都有潜在价值。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11