TerraVis:用 MLLM 工作流量化文生图的「世界一致性」缺陷
the-aiml · hf · 2026-10-09
TerraVis 是一个评估文生图「世界接地视觉一致性」的框架,针对现有美学/对齐指标抓不住的问题:结构畸形、不可能的解剖、物理不合理交互、空间关系不一致等。
它定义了覆盖对象、交互、场景三层共 18 种世界一致性违规的分类体系,用多阶段 MLLM 工作流先判定图像是否可评,再检测违规并区分轻重得出总分。在两个常用基准、多个开源与闭源模型上,TerraVis 与人类对世界一致性的判断相关性最强;结果还显示传统指标上表现强的模型仍可能存在大量世界一致性失败,证明这是互补的评测维度。代码已开源。
「多模态」频道最新
- 开源 huashu-art-motion:35 种艺术风格让画动起来,单条动画报价数百到千元 — AlchainHust · 2026-10-09
- VOCALOID7 AI Megpoid 预售:中岛爱声源,8 种声线可切换 — CurieuxExplorer · 2026-10-09
- Iris-3B 开源:像素空间生成与通用视觉学习模型发布 — Total-Resort-3120 · 2026-10-09
- LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分 — lmarena-ai · 2026-10-09
- 听声音就能认出 Opus 生成的视频,音画同步节奏成新指纹 — hudzah · 2026-10-09
- 孙悟空骑虎下山:AI 视频再现《大圣归来》级国风名场面 — lucky-plume · 2026-10-09