ReImaGin 用图像生成模型做多模态推理,六项任务最高提升 25%

MAI-Lab · hf · 2026-09-30

MAI-Lab 提出 ReImaGin,把图像生成模型用作多模态 LLM 的灵活视觉推理机制:不同于深度估计、目标检测等固定功能的视觉专家工具,图像生成模型接受自然语言指令,可执行开放式视觉操作,如去除遮挡、从多个不相连的房间视图生成平面图。

结果:在多视角空间推理、碰撞预测等六项视觉推理任务上,ReImaGin 一致超越纯文本推理和专用视觉工具基线,提升最高达 25%,验证了「生成式视觉推理」相比刚性工具管线的优势。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →