Lambda 发布 EdiVal-Agent:智能体评委评估图像编辑,与人类一致率达 81.3%
TheZachMueller · x · 2026-09-18
Lambda 与 UT Austin、UCLA、Microsoft 合作的 EdiVal-Agent(ICLR 2026)把图像编辑基础模型的评估变成智能体工作流,已开源。
核心问题:单一分数掩盖了图像编辑模型评估的细节——一次成功的编辑既要准确执行指令,又要保留不该变的内容,还要保持视觉质量,多轮编辑更需保住之前改动。人工检查成千上万输出太慢太贵,CLIP 等传统指标抓不住这些要求。
方法与结果:EdiVal-Agent 把评估拆成指令遵循、内容一致性、视觉质量三个维度,用智能体评委逐步检查:
- 智能体评委与人类判断一致率 81.3%
- 纯 VLM 评委 75.2%
- CLIPdir 仅 68.9%
这为训练迭代(训练→评估→定位失败→改进)提供了可扩展的自动评估闭环。
「多模态」频道最新
- 阿拉伯语圈热评 Pika 新平台:模型更全还开放 API — Kyrannio · 2026-09-18
- 新 Pika 集成 Seedance 2.5 与 GPT Image 2.5,网友晒组合生成效果 — Kyrannio · 2026-09-18
- H3 加速组合实测:FAST H3 V2 与 3-Step LoRA 速度画质对比 — Strange_Limit_9595 · 2026-09-18
- 开源 EasyAI:为小白包掉 ComfyUI 节点图的免费桌面 GUI — garionhk · 2026-09-18
- Pika 新版实测:角色设计到配乐剪辑,AI 动画一站式搞定 — Kyrannio · 2026-09-18
- 月流水 3000 万美元手游广告玩法,被指可用 GPT+Higgsfield API 复刻 — xiaohu · 2026-09-18