论文揭示VLM无图也能答题,多模态评测分数普遍虚高
ziv_ravid · x · 2026-07-04
研究者zivravid发表"Mirage Probes"论文,发现视觉语言模型(VLM)在未附图像的情况下仍能正确回答图像问题,这一"幻觉镜像"效应(Asadi et al.)导致多模态基准测试分数被系统性高估。论文探究了这一现象的成因机制,对如何更准确地评估VLM真实视觉理解能力具有重要意义,揭示了当前多模态评测体系中的潜在偏差。
「模型」频道最新
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27