新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距

NationalUniversityofSingapore · hf · 2026-09-30

新加坡国立大学团队发布 MaLiang-Harness,一个用可执行程序驱动 MLLM 图像/视频生成的统一框架,并首次定义了 Program-to-Visual (P2V) 差距:程序能正确运行,却可能违反要求的构图、外观或运动。

框架核心是把视觉生成组织为「构建-检查-修订」的持续过程,包含三个机制:

评测方面,团队在 MaLiang-IBench 上测试 11 个闭源 MLLM、在 MaLiang-VBench 上测试 4 个。GPT-6-Astra 在两个基准上均 100% 生成成功,96.0% 的图像任务和 76.9% 的视频任务满足全部质量阈值。研究还发现通用能力分数与视觉生成表现明显错位——分数相近的模型在满足视觉要求上差异巨大。代码已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →