Amazon's ReaLVR finds latent visual tokens ignore image evidence, scales latent reasoning to 235B

amazon · hf · 2026-10-01

Latent visual reasoning (LVR) lets multimodal LLMs compute in continuous latent tokens instead of verbalizing every step—but latent tokens aren't directly observable, making them hard to supervise.

Original post →

More from Research

Research channel →