Lambda 发布 EdiVal-Agent:智能体评委评估图像编辑,与人类一致率达 81.3%

TheZachMueller · x · 2026-09-18

Lambda 与 UT Austin、UCLA、Microsoft 合作的 EdiVal-Agent(ICLR 2026)把图像编辑基础模型的评估变成智能体工作流,已开源。

核心问题:单一分数掩盖了图像编辑模型评估的细节——一次成功的编辑既要准确执行指令,又要保留不该变的内容,还要保持视觉质量,多轮编辑更需保住之前改动。人工检查成千上万输出太慢太贵,CLIP 等传统指标抓不住这些要求。

方法与结果:EdiVal-Agent 把评估拆成指令遵循、内容一致性、视觉质量三个维度,用智能体评委逐步检查:

这为训练迭代(训练→评估→定位失败→改进)提供了可扩展的自动评估闭环。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →