MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie
cs.CV
2026-07-30
MPIE-Bench 用 2500 个视频挖来的修图样本配一套基于 3D 人体网格的评测,发现 VLM 裁判在交互项上打到 0.98 以上饱和,而 mesh 几何分最高只有 0.65 和 0.72,跟人类判断更一致。
文生图和个性化修图模型现在已经能把单个人画得很逼真。但只要任务变成把几个有名有姓的人塞进同一个接触动作里,拥抱、背负、缠斗,模型就开始翻车:肢体焊在一起、凭空长出多余的手脚、两个身体互相穿透。
现有的评测基本不碰这类解剖学和几何问题。常见做法是让 VLM(视觉语言模型)当裁判走 checklist 打分。问题在于,这种 checklist 在「交互」这一项上经常打到接近满分,可图里肉眼可见的错误还在。论文测出来,闭源 VLM 裁判在交互质量上给十个修图模型打分普遍在 0.98 到 0.99,而这些图明显是错的。打分饱和了,分不出高下。
MPIE-Bench 提供数据,MPIE-Eval 提供评测协议。数据是 2500 个从真实视频里挖出来的修图三元组,覆盖 405 个场景、14 类交互、4 档接触密度(C0 到 C3,从无接触到肢体级接触)。每个三元组由参考人物图加一帧更难的交互目标帧组成,目标帧从同一个真实交互里来,但留作 hold-out,模型没法直接抄像素。
评测有 6 个轴。其中 Count、Identity、Instruction、Quality 是常规的任务完成度指标,新增的两个轴 Anatomy 和 Interaction 才是重点,都基于一个冻结的公开多人网格重建模型(Multi-HMR)算出来。Anatomy 问的是图里每一团像人的东西,是不是都能被一整套完整的重建身体解释清楚,融合的肢体和凭空多出来的手脚正是解释不掉的。Interaction 问的是重建出的身体之间的穿透量和表面距离,是不是跟指令要求的接触对得上。两条 track 同时公布:Track A 用部署分辨率和各家闭源 API 原生设置,是主榜单;Track B 统一 letterbox 到 1024 平方像素,给一个分辨率公平的视角。
VLM checklist 和 mesh 几何给出完全不同的画面(完整集,Track A):
| 模型 | V-Anat | V-Inter | M-Anat | M-Inter |
| Gemini-3-Pro-Image | 0.95 | 0.99 | 0.65 | 0.68 |
| Seedream-5-Pro | 0.96 | 0.98 | 0.62 | 0.72 |
| GPT-Image-2 | 0.95 | 0.98 | 0.58 | 0.61 |
| FLUX.1-Kontext | 0.64 | 0.95 | 0.57 | 0.57 |
| ACE++ | 0.56 | 0.88 | 0.54 | 0.45 |
闭源模型的 V-Inter 都贴在 0.98 到 0.99 的天花板,mesh 的 M-Inter 却拉开到 0.45 到 0.72,有区分度。Anatomy 和 Interaction 的领先者还不是同一个:Gemini 解剖最干净(0.65),Seedream 交互几何最好(0.72),没有哪个模型两项都强。Identity 是闭源和开源差距最大的一项(闭源约 0.49 到 0.58,开源 0.02 到 0.21)。
人类一致性上,5 个标注员在 170 个硬样本(C2 到 C3 接触密度)上,mesh 的 M 比 VLM 的 V 在 10 项里有 9 项跟人类排序更一致,只输在数人数那一项。模型层面的偏好锚点跟 mesh 的 Anatomy 和 Interaction 相关性分别是 0.87 和 0.80。控制破坏实验里,把真实重建强行改坏,Interaction 在每种破坏下都下降,掉一个人直接降 0.35。权重和阈值的消融下,Anatomy 排序的 Spearman 相关保持在 0.98 以上。
做多人图像编辑的人能拿来直接用。它把「接触时刻的身体是否站得住」这件原来没法量化的事变成了可审计的分数,还附带每样本的 Multi-HMR dump 可以离线复核。对评测方法本身,它是个提醒:VLM 裁判在这类结构性错误上会饱和,别只信它的分数。
作者自己说绝对一致性只是中等(人类标注员平均 α=0.53),所以他们把人类一致性当排序参照,不当逐图 oracle。另一个没解决的点是接触部位的精度:现在的 Interaction 用的是全身接近度,握手、牵手、击掌这类关键在特定身体部位的提示词,跟其他场景的 pooled Interaction 差不多(约 0.59 对 0.56),换成手到手距离也只能小幅改善,部位级的几何判定是 future work。mesh 分数依赖重建前端的准确度,他们用第二个前端做交叉验证时,Anatomy 排序相关性掉到 0.92,Interaction 掉到 0.68,说明 Interaction 对前端选择更敏感。