UCLA发布VDiff-Bench:多模态模型细粒度图像差异识别集体翻车

UCLA · hf · 2026-09-10

UCLA 在 Hugging Face 发布 VDiff-Bench,一个针对细粒度图像差异识别的挑战性基准,用于评测多模态语言模型发现细微低层视觉变化的能力。结果显示当前多模态模型在检测微妙图像差异上存在重大弱点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →