Open-Source 10B VLX-Seek-1.5 Model for Embodied Visual Grounding Released

pmttyji · reddit · 2026-08-10

omlab released VLX-Seek-1.5-10B on Hugging Face, an open-source 10B model for fine-grained perception and visual grounding in embodied scenarios. It uses region retrieval and reference instead of coordinate generation, targeting drones, robots, surveillance, and edge devices. Highlights include stronger visual capability, faster inference, and explicit absent-target rejection. Sizes: 0.6B, 3B, 10B.

Original post →

More from Embodied

Embodied channel →