DEER-3D:用反事实场景编辑修复 3D-LLM 空间接地偏差
YonatanBitton · x · 2026-09-10
ECCV 2026 论文提出 DEER-3D,一个错误驱动的 3D 场景编辑框架,用于改进 3D-LLM 的视觉与空间接地能力。
- 动机:3D-LLM 在把语言接地到 3D 环境的空间元素上仍不准确,部分原因是训练数据偏语言推理而缺空间理解,存在固有接地偏差。
- 方法:通过「分解—诊断—编辑—重训」结构化循环,先定位谓词级错误(如属性或空间关系),再做最小化的谓词对齐场景编辑(如重新着色、移动物体),构造针对性反事实问答对作为训练监督,无需昂贵的场景重建或大规模 3D 数据采集。
- 结果:在多个 3D 接地与场景理解 benchmark 上迭代精炼后均取得一致提升,空间与属性接地能力更强。
「多模态」频道最新
- Astra 几何 + Dreamina 渲染:一个场景不漂移的 AI 视频工作流 — JaynitMakwana · 2026-09-10
- 实测泼冷水:GPT-6 Astra 的 Blender 3D 建模远不如演示惊艳 — Next_Technology6361 · 2026-09-10
- Opus 5 让"人脸合唱团"唱早安歌,网友戏称冥想音乐 — VoidStateKate · 2026-09-10
- Suno 转向授权音乐训练,但新模型仍用旧输出数据引担忧 — jordiponsdotme · 2026-09-10
- LingBot-World 2.0 开源:1.3B 世界模型在单张消费级 GPU 实时生成交互世界 — dair_ai · 2026-09-10
- Cohere Labs 分享:构建亚洲语言语音 Agent 的实测要点与数据 — Cohere_Labs · 2026-09-10