SpatialCORE 把定位置信度变成学习信号,刷新视觉空间推理 SOTA

Rafi Ibn Sultan · hf · 2026-10-01

空间推理一直是大型视觉-语言模型的弱项,现有方法虽引入 grounding(预测边界框/掩码),但只优化最终答案正确性,答案对了即使定位不可靠也照样得分。

SpatialCORE 是一个后训练框架,把模型对自身 grounding 的置信度转化为学习信号:

该方法在多个基准上取得开源与专用空间推理模型中的 SOTA,并能零样本迁移到未见过的数据分布。代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →