埃默里提出 DLR 框架,让 VLM 每步推理都重新看图

新智元 · wechat · 2026-09-26

埃默里大学团队的 Decompose-Look-and-Reason(DLR)被 EMNLP 2026 主会接收,针对多模态推理中「文本链越拉越长、视觉证据逐步弱化」的问题。

核心方法:推理循环分三步——Decompose 动态生成需要视觉验证的子问题(premise);Look 用 visual grounder 以 premise 的 hidden state 为条件做 cross-attention,提取连续视觉 latent(而非固定 ROI/patch);Reason 基于该视觉证据生成 grounded rationale 后进入下一轮。

三阶段训练:先冻结主干预训练 visual grounder(双向 InfoNCE 对齐);再 SFT 学结构化轨迹;最后用 Spherical Gaussian Latent Policy(SGLP)把强化学习扩展到连续视觉 latent——在超球面语义方向上加高斯扰动探索,与文本策略基于 Dr.GRPO 联合优化。

结果:以 Qwen3-VL-8B-Thinking 为骨干,在 V(83.8)、MathVista(82.7)、MMMU-Pro(63.5)、MMStar(76.2)上分别提升 +4.2、+3.5、+2.6、+3.9 个百分点。消融显示移除 latent policy 目标后 MathVista 从 82.7 跌至 57.1。遮挡 DLR attention 最高区域使 V 准确率暴跌 47.3 个百分点,为视觉证据的功能相关性提供定量证据;案例还展示基线因 weak grounding 生成 1.5 万 token 仍答错,而 DLR 分步看图直达答案。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →