DeepMind 提出潜在视觉推理新方法,九项视觉基准平均提升 5.6 分

GoogleDeepMind · hf · 2026-09-30

Scaffolding Minds:优化多模态潜在推理的目标表征

背景:潜在推理(latent reasoning)通过两阶段训练实现视觉思维链:SFT 阶段把辅助图像编码为 latent token 教模型视觉推理,RL 阶段再用奖励信号精炼这些 token。

发现的两个局限:

方法:训练一个专门的「脚手架编码器」提供优化的 latent 空间目标,并同时学习 RL 采样器的均值和方差(引入探索)。两个改进互补。

结果:在 FrozenLake 空间规划上比最强潜在推理基线高 9.5 分,32×32 网格上扩大到 +19 分,九项视觉推理基准平均提升 5.6 分。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →