DeepMind 实习成果:把价值图放进 VLM 思维链,多模态潜在推理提效 20%
burny_tech · x · 2026-09-15
作者分享在 Google DeepMind 实习期间的工作 Scaffolding Minds,探索多模态潜在推理。
- 核心思路:将价值图(value maps)作为潜在视觉 token 直接嵌入 VLM 的思维链,让模型「用价值函数思考」而不仅是看图
- 难点在于现成的视觉特征并不天然适合作为「思维素材」,因此进一步学习潜在表示本身
- 学习后的表示相比冻结编码器带来平均约 20% 的相对准确率提升
- 结论:模型「看到什么」和「该用什么来思考」可能是很不同的表示
「多模态」频道最新
- 用 Gemini+HyperFrames 做短视频,自建模板库一键复刻 — toolstelegraph · 2026-09-15
- RX 6800 16GB 本地跑 Z-Image Turbo:每张图 43 秒的完整配置 — AstroFieldsGlowing · 2026-09-15
- 实测:FPV 镜头 Seedance 2.0 仍碾压 2.5,速度感与动感更强 — azed_ai · 2026-09-15
- Reddit 网友展示自用 AI 制作的短视频作品 — anotheraccountaus · 2026-09-15
- 一条视频生成 4D 高斯泼溅,4DAnyone 实测体验分享 — mickmumpitz · 2026-09-15
- 《Lost Souls》:AI 生成的电影感短片章节亮相 Reddit — Choice_Mongoose7320 · 2026-09-15