新 VLM 解释评分让用户判断准确率提升 11.1%
_jessethomason_ · x · 2026-07-28
来自 USC 和 Carnegie Mellon 的这项工作提出了两个衡量 VLM 解释质量的新分数:Visual Fidelity 用来衡量解释是否忠于视觉上下文,Contrastiveness 用来衡量解释是否抓住了能区分预测与其他可能答案的关键细节。
作者在 A-OKVQA、VizWiz 和 MMMU-Pro 上验证发现,这两个分数与模型正确性的校准关系优于以往的解释质量指标。进一步的用户研究中,参与者在看不到图像的情况下判断 VLM 预测是否准确;当同时展示这些质量分数后,判断准确率提升了 11.1%,把“错误地相信了不对答案”的比例降低了 15.4%。
所属事件:ACL 2026论文提出VLM解释可信度评估新指标(2 条相关)→
「研究」频道最新
- 学者痛批学术现状:百篇论文仅一篇正确,却被迫包装成真理 — RexDouglass · 2026-07-29
- 一个自主编码系统从零做出数据库引擎并通过 600 万 SQLite 测试 — jiayq · 2026-07-29
- Ono 制药与 Phylo 合作,把智能体 AI 引入药物发现 — KexinHuang5 · 2026-07-29
- AM Forum 在 GitHub 上线,做人本 AI 研究讨论区 — EchoShao8899 · 2026-07-29
- Stanford HAI 称世界模型需在安全部署前建立新治理框架 — StanfordHAI · 2026-07-29
- 研究中的委托-代理问题:研究者只关注自己需要的拼图 — RexDouglass · 2026-07-28