UCLA releases VDiff-Bench, exposing multimodal models' weakness at fine-grained image differences

UCLA · hf · 2026-09-10

UCLA released VDiff-Bench on Hugging Face, a challenging benchmark for fine-grained image difference identification that evaluates multimodal language models on detecting subtle low-level visual changes. Results reveal major weaknesses in current models' ability to spot fine visual differences.

Original post →

More from Research

Research channel →