新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距
NationalUniversityofSingapore · hf · 2026-09-30
新加坡国立大学团队发布 MaLiang-Harness,一个用可执行程序驱动 MLLM 图像/视频生成的统一框架,并首次定义了 Program-to-Visual (P2V) 差距:程序能正确运行,却可能违反要求的构图、外观或运动。
框架核心是把视觉生成组织为「构建-检查-修订」的持续过程,包含三个机制:
- PEG:持久化可执行生成状态,保留程序与任务上下文;
- TGP:可追溯生成过程,把每次编辑关联到渲染证据;
- REV:修订感知的编辑与验证,完成前检查当前版本。
评测方面,团队在 MaLiang-IBench 上测试 11 个闭源 MLLM、在 MaLiang-VBench 上测试 4 个。GPT-6-Astra 在两个基准上均 100% 生成成功,96.0% 的图像任务和 76.9% 的视频任务满足全部质量阈值。研究还发现通用能力分数与视觉生成表现明显错位——分数相近的模型在满足视觉要求上差异巨大。代码已开源。
「多模态」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- KAIST 推出 Thinking Reward Model:先定评分细则再审图,开源奖励模型登顶 — Xuehai Bai · 2026-09-30