SpatialCORE 把定位置信度变成学习信号,刷新视觉空间推理 SOTA
Rafi Ibn Sultan · hf · 2026-10-01
空间推理一直是大型视觉-语言模型的弱项,现有方法虽引入 grounding(预测边界框/掩码),但只优化最终答案正确性,答案对了即使定位不可靠也照样得分。
SpatialCORE 是一个后训练框架,把模型对自身 grounding 的置信度转化为学习信号:
- 通过自调节空间奖励,按坐标 token 置信度加权每个预测框的匹配质量,鼓励模型基于自信定位的对象进行推理;
- 答案门控将 grounding 优化与最终答案正确性绑定。
该方法在多个基准上取得开源与专用空间推理模型中的 SOTA,并能零样本迁移到未见过的数据分布。代码已开源。
「研究」频道最新
- 学者质疑:新模型能解旧难题,但学习理论缺可预测猜想 — brianryhuang · 2026-10-01
- ParallelPilot 论文:并行编码智能体吞吐量提升 63% — erichorvitz · 2026-10-01
- 多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31% — SergioPaniego · 2026-10-01
- LATENT 用不完美人类动数据教会人形机器人打网球对拉 — chris_j_paxton · 2026-10-01
- 博科尼研究:人人有 AI 的时代,学校最该教因果推理 — daveholtz · 2026-10-01
- DeepSeek Sandbox 论文:智能体自己翻日志找泄露答案、装新包 — mattsheehan88 · 2026-10-01