RISEBench++: 65 reasoning-based visual editing tasks; best model GPT-Image-2.5 hits only 56.6%

VisionXLab · hf · 2026-10-09

Original post →

More from Multimodal

Multimodal channel →