亚马逊 ReaLVR 揭示潜在视觉推理盲区,首次扩展到 235B 模型
amazon · hf · 2026-10-01
潜在视觉推理(LVR)让多模态大模型用连续 latent token 做中间计算,而非逐步用文字表达。但 latent token 不可直接观测,难以监督。
- 发现:作者系统分析 latent token 行为,识别出「潜在证据-信用缺口」——当图像扰动会改变正确答案时,latent token 仅作出微弱响应,根源是 GRPO 训练缺乏显式监督。
- 方法:提出 ReaLVR,把视觉证据监督引入模型自由生成的 latent 轨迹:对比正确答案与模型生成的错误答案确定哪里需要更强监督,对比相关与不匹配视觉证据确定要保留什么。
- 结果:跨三个模型家族均超越 LVR 基线,Qwen2.5-VL-7B 五任务平均 63.7%;并首次将潜在视觉推理扩展至 235B 前沿规模,改进依然稳健。
「研究」频道最新
- 多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31% — SergioPaniego · 2026-10-01
- LATENT 用不完美人类动数据教会人形机器人打网球对拉 — chris_j_paxton · 2026-10-01
- 博科尼研究:人人有 AI 的时代,学校最该教因果推理 — daveholtz · 2026-10-01
- DeepSeek Sandbox 论文:智能体自己翻日志找泄露答案、装新包 — mattsheehan88 · 2026-10-01
- 男子用 AI 帮自己的狗设计癌症疫苗,多个肿瘤 reportedly 缩小 — hey_abusiddik · 2026-10-01
- 不到 10 人拿下五大闭源实验室中的四家,Halluminate 融 3000 万美元做 RL 环境 — ycombinator · 2026-10-01