LeRF: Learning Reference Coordinate Frames for Perspective Taking Reasoning
Bang Xiao, Wenqi Jia, Ozgur Kara, Tiancheng Shen, Yibo Yang, Bolin Lai, Junho Kim, James Matthew Rehg
cs.CV
2026-09-29
LeRF 教 VLM 预测并渲染参考坐标系,再做换视角空间推理。假想视角任务较 Qwen3.5-9B 提升 11 个百分点,反超 GPT-5.6。
Perspective taking(视角采择)指从指定视角解读空间关系:另一个实体的视角,或想象中观察者的视角。这是导航、人机协作这类具身任务的基本能力,但 VLM 在这里系统性翻车,典型症状是不管问的是谁的视角,都按相机视角作答。数字很直观:GPT-5.6-Terra 在 OmniSpatial 视角采择子集上,相机视角(Ego)81.37%,实体视角(Allo)55.85%,假想视角(Hypo)53.01%。
已有两条修复路线各有痛点。SpatialReasoner 显式估计 3D 坐标再做几何计算,3D 感知的误差会直接传进推理;APC 用多个外部视觉模型重建粗糙 3D 场景再转换视角,多阶段流水线开销大,还默认每个问题都需要转换。论文的起点是一个低成本观察:拿现成的朝向估计模型 OrientAnything-V2 把参考坐标系投影叠到图上,Qwen3.5-9B 的回答就明显变好。既然画个坐标系就有用,能不能让模型自己学会画?这就是 LeRF(UIUC、Amazon AGI 等机构,代码已开源)。
LeRF 建在 Qwen3.5-4B/9B 上,推理是两轮 tool-call:
训练分两段。SFT 从 ImageNet3D、Omni6DPose-SOPE、BEDLAM 的物体与人体姿态数据造坐标系标签(GPT-5.6-Terra 负责生成指代描述、过滤歧义样本),约 20% 是不用工具的样本,教模型「何时该省」;LoRA rank 8,视觉编码器冻结。RL 段用 GRPO 在 MultihopSpatial-train(6.79K 条)和 SpatialReasoner-RL(1.2K 条)上训练,奖励只有最终答案对错的 0/1,坐标系预测 token 被排除在 policy gradient 外,防止把 SFT 学到的预测能力冲掉。全部训练用 4 张 RTX PRO 6000 Blackwell。
| 方法 | OmniSpatial Allo | OmniSpatial Hypo | 3DSRBench Ori | V-Spatial P-Rel |
| Qwen3.5-9B | 47.13 | 44.58 | 48.17 | 65.51 |
| GPT-5.6-Terra | 55.85 | 53.01 | 63.32 | 77.20 |
| LeRF-9B | 54.04 | 55.66 | 53.76 | 74.23 |
LeRF-9B 在五个需要换视角的子集(Allo、Hypo、3DSR Orientation、V-Spatial 两项)上全部居开源方法第一,3DSR Multi-Object 第二;Hypo 和 V-Spatial P-Obj 还超过了全部参评闭源模型。相对基座,Hypo +11.08 pp、Allo +6.91 pp、P-Rel +8.72 pp。代价是 Ego 从 80.20 降到 74.31,论文承认这个 trade-off。
坐标系预测本身也变强:EMDB 人体子集上,LeRF-9B 三轴全部误差小于 15° 的比例 43.12%,比专门的朝向估计模型 OrientAnything-V2(19.35%)高 23.77 pp,原点定位 99.82%;基座 Qwen3.5-9B 只有 1.11%。OmniNOCS-Objectron 物体子集上 All@15° 为 49.58%,略低于 OrientAnything-V2 的 50.42%。
两项分析给出机制证据。推理时把渲染出的坐标系逆时针转 90°,总体准确率从 57.97% 掉到 54.05%,Hypo 掉得最多(7.95 pp),说明模型确实在读画在图上的轴。工具调用有选择性:LeRF-9B 只在 2.94% 的相机视角题上调用,另两类超过 84%。
消融:SFT-only 整体 40.86%,比基座 52.76% 还低,SFT 单独做会伤原有推理能力;但用它初始化再 RL 达到 57.97%,比直接从基座 RL(53.76%)高 4.21 pp。渲染收益集中在假想视角:训练推理都渲染 55.66%,都不渲染 49.40%。
这篇把换视角推理从隐式的 mental rotation 改成显式的「画出来再看」,推理期只需要一个确定性渲染器,不接外部感知模型、不重建 3D。9B 模型、LoRA、4 张卡就能复现,对做具身智能和机器人的团队是可直接搬走的方案:教模型自建轻量结构化中间表示,替代堆外部模块。训练配方也有通用性:SFT 教工具使用、RL 只用最终答案做奖励、把工具调用 token 排除在梯度外,这套做法可以平移到其他 tool-use 训练。
同时要清楚:对 APC、SpatialReasoner 是明确改进,对闭源模型只是部分反超,GPT-5.6-Terra 在 Allo、3DSRBench 两项和 P-Rel 上仍然领先。
作者自述:遮挡、视觉歧义、实体朝向不清时,坐标系预测会出错并向下游传播;只处理静态图像,参考系随时间变化的动态场景未验证。
读下来另有几点。Ego 掉 5.89 pp,说明「何时调用工具」的边界还不干净,以相机视角为主的应用是净损失。渲染收益高度集中在 Hypo(约 6 pp),整体只差 0.79 pp,「渲染不可或缺」的结论主要对假想视角成立。RL 只训了 50 步,更长训练下的表现没有数据。