腾讯 ProLaViT 用渐进隐空间链提升多模态推理

机器之心 · wechat · 2026-07-21

ProLaViT:让多模态模型在隐空间里“步步推理”

腾讯内容服务部 BAC 提出 ProLaViT(Progressive Latent Visual Thought),试图解决多模态大模型“看得见但想不对”的问题。它不再依赖一次性隐空间预测,而是把视觉推理拆成渐进式链条:空间任务走 定位→聚焦→分离,逻辑任务走 假设→批判→验证。

核心方法

实验结果

论文基于 Qwen2.5-VL-7B-Instruct 实现,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等基准上测试,全文方法的平均准确率达到 75.11%。

这项工作提出了一条新的多模态推理路线:把推理从离散文本链,迁移到连续、结构化的隐空间里,在准确率、稳定性和可解释性之间取得平衡。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →