开源10B视觉定位模型VLX-Seek-1.5发布,面向机器人与无人机

pmttyji · reddit · 2026-08-10

omlab在Hugging Face发布了VLX-Seek-1.5-10B,这是一个面向具身场景的开源10B模型,专注于细粒度感知和视觉定位。该模型采用区域检索和区域引用而非坐标生成,支持无人机、机器人、监控等边缘场景。亮点包括:更强的视觉能力、更快的推理设计、显式拒绝缺失目标以减少幻觉。模型计划推出0.6B、3B和10B版本。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →