DEPICT 免训练指标:答案一致性法把否定理解准确率从 19% 提到 88%

swordhealth · hf · 2026-10-06

Sword Health 提出 DEPICT,一种免训练的图文对齐评分指标,用于 caption 评测、幻觉检测、数据筛选与文生图基准测试,针对现有方法的短板:微调式指标绑定单一骨干与分布、整体式指标漏细节、分解式指标依赖「固定 YES 假设」而误罚忠实图像。

方法:不再用固定参考答案,而是计算「看图回答」与「只看 caption 回答」之间的期望一致性,并按 caption 对问题的决定性程度加权;再将一致性得分与整体得分合并以找回分解丢失的上下文。

结果:该一致性规则将否定理解准确率从 19% 提升到 88%;在 5 个基准、3 个模型家族 11 个骨干上评测,DEPICT 超过所有免训练指标,并在 3 个人类相关性基准中的 2 个上超过微调式评估器。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →