UC Berkeley Releases CoVA-SFT: Chain of Visual Abstractions Dataset

UCBerkeley · hf · 2026-09-02

UC Berkeley released CoVA-SFT, a large-scale multimodal reasoning dataset. It is designed to teach language models to interleave text and visual abstractions via structured reasoning steps, improving performance on visual reasoning benchmarks.

Original post →

More from Multimodal

Multimodal channel →