新 VLM 解释评分让用户判断准确率提升 11.1%

_jessethomason_ · x · 2026-07-28

来自 USC 和 Carnegie Mellon 的这项工作提出了两个衡量 VLM 解释质量的新分数:Visual Fidelity 用来衡量解释是否忠于视觉上下文,Contrastiveness 用来衡量解释是否抓住了能区分预测与其他可能答案的关键细节。

作者在 A-OKVQA、VizWiz 和 MMMU-Pro 上验证发现,这两个分数与模型正确性的校准关系优于以往的解释质量指标。进一步的用户研究中,参与者在看不到图像的情况下判断 VLM 预测是否准确;当同时展示这些质量分数后,判断准确率提升了 11.1%,把“错误地相信了不对答案”的比例降低了 15.4%。

所属事件:ACL 2026论文提出VLM解释可信度评估新指标(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →