新型具身视觉模型通过上下文重建精准边界
针对传统自监督视觉模型随机遮挡图像块导致机器人难以在物理空间精准导航的问题,研究人员提出了一种新型边界感知训练法。该架构在训练时强制将边界token放入mask中,利用上下文重建复杂边缘和轮廓。模型直接从原始像素学习结构,不依赖预训练,并采用a-contrario统计检验自动过滤噪声,显著提升了具身智能的导航能力。
2026-07-08 ~ 2026-07-08 · 2 条相关
- 为机器人导航设计的边界感知训练法 — thetripathi58 · 2026-07-08
- 用上下文重建边缘的具身视觉模型 — thetripathi58 · 2026-07-08