LeRF 框架教 VLM 建参考坐标系,突破视角理解瓶颈
UIUC-CS · hf · 2026-09-30
UIUC 团队提出 LeRF(Learning Reference Coordinate Frames),解决 VLM 在视角推断(perspective taking)上总是默认相机视角、无法从他人视角理解空间关系的问题。
- 方法:给定图像与问题,模型先判断是否需要参考坐标系;若需要,则定位参考实体并预测坐标系原点与实体中心参考系,再用轻量渲染器将坐标系叠加到图像上,供后续推理使用,无需外部感知模型或显式 3D 重建。
- 训练:先监督微调教会选择性工具调用与参考系预测,再在空间 VQA 数据上做强化学习,提升依参考系的推理能力。
- 结果:在多个视角推断基准上持续超越骨干模型,对开源方法也有强表现;参考系定位与朝向估计同样提升。
「研究」频道最新
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- 美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36% — meituan · 2026-09-30
- KAIST 提出 GRAFT:模型间互换轨迹,异构模型 RLVR 平均提升 2.1 分 — kaist-ai · 2026-09-30