腾讯 ProLaViT 用渐进隐空间链提升多模态推理
机器之心 · wechat · 2026-07-21
ProLaViT:让多模态模型在隐空间里“步步推理”
腾讯内容服务部 BAC 提出 ProLaViT(Progressive Latent Visual Thought),试图解决多模态大模型“看得见但想不对”的问题。它不再依赖一次性隐空间预测,而是把视觉推理拆成渐进式链条:空间任务走 定位→聚焦→分离,逻辑任务走 假设→批判→验证。
核心方法
- 内生自蒸馏:不请 SAM、DINO、DepthAnything 等外部视觉专家,而是直接用模型自身预训练视觉编码器做老师。
- 可编程合成流水线:训练时自动生成多步辅助图像,例如裁剪、分割等,中间监督由代码保证精度,不需要人工标注。
- 距离加权多样性损失:避免隐空间坍缩,让相邻步骤保持适度连续,远距离步骤保持区分。
实验结果
论文基于 Qwen2.5-VL-7B-Instruct 实现,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等基准上测试,全文方法的平均准确率达到 75.11%。
- 在复杂空间任务上提升明显,尤其是 VisPuzzle(+2.25%) 和 BLINK-Jigsaw(+10.00%)。
- 在 ChartQA 上达到 78.99%,在 BLINK-Jigsaw 上相较基座模型提升 +16.67%。
- 消融实验显示,去掉渐进式链条、打乱步骤顺序,或改用外部教师,都会明显掉点。
这项工作提出了一条新的多模态推理路线:把推理从离散文本链,迁移到连续、结构化的隐空间里,在准确率、稳定性和可解释性之间取得平衡。
「多模态」频道最新
- 先做分镜再生成,AI 舞蹈视频更容易保持一致性 — aftahi_ai · 2026-07-22
- Runpod MCP 让 Claude 直接编排图像和视频生成工作流 — 802high · 2026-07-22
- Midjourney 把蜜蜂做成碎片爆炸梗图 — michaelrabone · 2026-07-22
- 物理奖励能改进视频生成,但不等于物理引擎 — Dapper-Drawer4546 · 2026-07-22
- HeyGen 给 coding agent 接入 7.5 万图片和 1 万音乐 — HeyGen · 2026-07-22
- Reddit 用户求 20GB 显存内的 ComfyUI 成人向工作流 — hobbyist2020 · 2026-07-22