埃默里提出 DLR 框架,让 VLM 每步推理都重新看图
新智元 · wechat · 2026-09-26
埃默里大学团队的 Decompose-Look-and-Reason(DLR)被 EMNLP 2026 主会接收,针对多模态推理中「文本链越拉越长、视觉证据逐步弱化」的问题。
核心方法:推理循环分三步——Decompose 动态生成需要视觉验证的子问题(premise);Look 用 visual grounder 以 premise 的 hidden state 为条件做 cross-attention,提取连续视觉 latent(而非固定 ROI/patch);Reason 基于该视觉证据生成 grounded rationale 后进入下一轮。
三阶段训练:先冻结主干预训练 visual grounder(双向 InfoNCE 对齐);再 SFT 学结构化轨迹;最后用 Spherical Gaussian Latent Policy(SGLP)把强化学习扩展到连续视觉 latent——在超球面语义方向上加高斯扰动探索,与文本策略基于 Dr.GRPO 联合优化。
结果:以 Qwen3-VL-8B-Thinking 为骨干,在 V(83.8)、MathVista(82.7)、MMMU-Pro(63.5)、MMStar(76.2)上分别提升 +4.2、+3.5、+2.6、+3.9 个百分点。消融显示移除 latent policy 目标后 MathVista 从 82.7 跌至 57.1。遮挡 DLR attention 最高区域使 V 准确率暴跌 47.3 个百分点,为视觉证据的功能相关性提供定量证据;案例还展示基线因 weak grounding 生成 1.5 万 token 仍答错,而 DLR 分步看图直达答案。
「多模态」频道最新
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- 6M tokens 成本 $65,Opus 5.5 端到端生成音乐视频已"不稀奇" — rickasaurus · 2026-09-27
- 一条 prompt 生成奇点主题视频essay,Runway CEO 演示全流程 — c_valenzuelab · 2026-09-27
- 8GB 显存 5060 本地跑 Qwen 图像生成,网友称效果惊人 — tryku2 · 2026-09-27
- 想拍软件质量讲解视频,结果全用 AI 做成了 MV — EricBuess · 2026-09-27
- 用 Opus 5.5 做 100 支视频后,开源 39 种风格的提示词库 — dotey · 2026-09-27