DEPICT 免训练指标:答案一致性法把否定理解准确率从 19% 提到 88%
swordhealth · hf · 2026-10-06
Sword Health 提出 DEPICT,一种免训练的图文对齐评分指标,用于 caption 评测、幻觉检测、数据筛选与文生图基准测试,针对现有方法的短板:微调式指标绑定单一骨干与分布、整体式指标漏细节、分解式指标依赖「固定 YES 假设」而误罚忠实图像。
方法:不再用固定参考答案,而是计算「看图回答」与「只看 caption 回答」之间的期望一致性,并按 caption 对问题的决定性程度加权;再将一致性得分与整体得分合并以找回分解丢失的上下文。
结果:该一致性规则将否定理解准确率从 19% 提升到 88%;在 5 个基准、3 个模型家族 11 个骨干上评测,DEPICT 超过所有免训练指标,并在 3 个人类相关性基准中的 2 个上超过微调式评估器。
「多模态」频道最新
- 「全息数据投影」提示词分享:一键生成科幻风人物投影 — azed_ai · 2026-10-06
- 开源 huashu-art-motion skill:35 种艺术风格让画动起来 — AlchainHust · 2026-10-06
- 一条提示词跑通 Claude Opus 与 Seedance 视频生成 — Itchy-Car-904 · 2026-10-06
- RTX 5080 本地跑 MiniMax H3:17 秒 720p 视频要多久? — off_rs · 2026-10-06
- RTX 5060 8GB 上跑 Krea 2:LoRA 保角色+Chroma 定构图的写实工作流 — Wide_Director_8897 · 2026-10-06
- Reddit 展示 AI 生成动漫舞台:烟雾闪电氛围大片 — Amazing_Skill_6080 · 2026-10-06