ReImaGin 用图像生成模型做多模态推理,六项任务最高提升 25%
MAI-Lab · hf · 2026-09-30
MAI-Lab 提出 ReImaGin,把图像生成模型用作多模态 LLM 的灵活视觉推理机制:不同于深度估计、目标检测等固定功能的视觉专家工具,图像生成模型接受自然语言指令,可执行开放式视觉操作,如去除遮挡、从多个不相连的房间视图生成平面图。
结果:在多视角空间推理、碰撞预测等六项视觉推理任务上,ReImaGin 一致超越纯文本推理和专用视觉工具基线,提升最高达 25%,验证了「生成式视觉推理」相比刚性工具管线的优势。
「多模态」频道最新
- 用 Add Guide 关键帧修复 Viggle Animate 漂移,速度精度双超 Scail2 — Tablaski · 2026-09-30
- NoSpoon 10分钟花20美元自动生成长片,全自动化AI视频产品亮相 — Kyrannio · 2026-09-30
- 单图+一条 prompt 生成 30 秒豪华旅拍广告,完整 Seedance 2.5 提示词公开 — umesh_ai · 2026-09-30
- Topaz 网页版视频放大提速 10 倍,一张图+一条 prompt 生成 30 秒广告 — umesh_ai · 2026-09-30
- LTX 2.3 Obscura 视频指令删除翻车:让删椅子却删了沙发和地毯 — robertwellesley · 2026-09-30
- LichtFeld 重建效果引关注,博主称其表现令人印象深刻 — janusch_patas · 2026-09-30