Technion 提出误导图像压力测试:13 个 VLM 评审近两成标签被无关图片动摇
Technion · hf · 2026-10-01
Technion 团队提出 MIST(Misleading-Image Stress Test):200 句可作比喻或字面双读的英文句子,分别配一致图像、误导图像或不配图,要求标签只由句子本身决定,任何图片都不应改变答案。
实测发现:
- 在 13 个 VLM 评审模型上,一致图像改变了 20.5% 的标签,误导图像改变 19.4%,两者几乎相同,且都高于删除「忽略图像」指令时 11.6% 的波动。
- 只有 37% 的翻转标签朝向图像实际描绘的含义;与人工标注的一致性在有无图像时完全不变。
- 结论:动摇评审的是「有图存在」这件事,而非图的内容——用 VLM 替代人类标注时的可替代性测试,测出的更多是评测配置而非模型本身。
「模型」频道最新
- 实测GPT-6 Astra:agentic提升显著,ARC-AGI-3成绩极度依赖测试框架 — No-Soil-5789 · 2026-10-01
- Gemini 4 argon 对比 GPT 6.1 sol:同 prompt 实测结果差异明显 — iamfakhrealam · 2026-10-01
- Claude 高推理档位 token 爆量烧钱,除非确需否则保持 medium — intellectronica · 2026-10-01
- 传 Gemini 4 Argon 输出上限达百万 token,是飞跃还是营销 — minimanishtic · 2026-10-01
- 付费用户曝 ChatGPT Projects 旧对话大面积无法加载,担忧工作记录丢失 — yaxir · 2026-10-01
- 开发者再遇 OpenAI usage 接口故障,ChatGPT 登录凭证被拒 — lucasmeijer · 2026-10-01