DeepMind 提出潜在视觉推理新方法,九项视觉基准平均提升 5.6 分
GoogleDeepMind · hf · 2026-09-30
Scaffolding Minds:优化多模态潜在推理的目标表征
背景:潜在推理(latent reasoning)通过两阶段训练实现视觉思维链:SFT 阶段把辅助图像编码为 latent token 教模型视觉推理,RL 阶段再用奖励信号精炼这些 token。
发现的两个局限:
- SFT 阶段直接用现成视觉编码器,得到的 latent 表征与下游推理任务对齐不佳
- 现有 RL 只用确定性正则化约束策略漂移,没有为潜在轨迹创造探索空间
方法:训练一个专门的「脚手架编码器」提供优化的 latent 空间目标,并同时学习 RL 采样器的均值和方差(引入探索)。两个改进互补。
结果:在 FrozenLake 空间规划上比最强潜在推理基线高 9.5 分,32×32 网格上扩大到 +19 分,九项视觉推理基准平均提升 5.6 分。
「研究」频道最新
- CLM 发布即支持 Pi-agent,一条命令即可上手体验 — RulinShao · 2026-09-30
- 无电 100 位加法:Nature 论文展示脚手架 DNA 计算机 — jiqizhixin · 2026-09-30
- 每日探测 34 个 LLM API 抓静默变更:DeepSeek 推理用量一夜涨 10 倍 — Electrical_Rip892 · 2026-09-30
- 新预印本:估 LLM 嵌入维度别用 PCA,EGA 恢复率达 97.6-100% — GolinoHudson · 2026-09-30
- 不信厂商跑分?他写 28 分钟指南教你自建 eval 并爬坡优化 — ghumare64 · 2026-09-30
- 只许输出 Simple Wikipedia 没见过的二元组,Gemma 4B 被逼出满屏错字 — cephaloform · 2026-09-30