Soft Spatial Reasoning:用连续软状态替代硬 CoT 做空间推理
Rafi Ibn Sultan · hf · 2026-10-01
大型视觉-语言模型做空间推理通常依赖 CoT,每步必须提交到单个离散 token——过早的离散化会让一次错误选择沿推理链传播。
作者提出 Soft Spatial Reasoning 后训练框架:
- 每个中间推理步通过混合 token 嵌入形成连续「软状态」,让多个候选解释共同影响下一步,避免过早二选一;
- 软化程度需按步调整:保留多个候选可能保住有用的空间解释,但候选间空间关系冲突时混合会干扰推理。核心组件 AdaptSoft 控制器利用当前隐状态与预测不确定性自适应调节每步软化程度;
- 训练采用梯度对齐目标,无需中间推理监督即可为软化控制提供分步学习信号。
在多个空间基准上,同骨干下超越硬 CoT 与固定软化基线及一批现有 LVLM。代码已开源。
「研究」频道最新
- 学者质疑:新模型能解旧难题,但学习理论缺可预测猜想 — brianryhuang · 2026-10-01
- ParallelPilot 论文:并行编码智能体吞吐量提升 63% — erichorvitz · 2026-10-01
- 多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31% — SergioPaniego · 2026-10-01
- LATENT 用不完美人类动数据教会人形机器人打网球对拉 — chris_j_paxton · 2026-10-01
- 博科尼研究:人人有 AI 的时代,学校最该教因果推理 — daveholtz · 2026-10-01
- DeepSeek Sandbox 论文:智能体自己翻日志找泄露答案、装新包 — mattsheehan88 · 2026-10-01