LingBot-Vision:基于边界建模的自监督 ViT
tom_doerr · x · 2026-08-23
LingBot-Vision 发布了一套用于密集空间感知的自监督视觉 Transformer (ViT) 骨干网络,参数规模从 ViT-S/16 到 11 亿参数的 ViT-g/16。
核心特点:
- 使用「掩码边界建模」(Masked Boundary Modeling)进行预训练。
- 该目标函数鼓励生成具有空间结构的补丁特征,同时保持强语义表示。
- 模型能同时学习边界、形状和语义区域。
项目包含代码实现、示例及配套论文。
「研究」频道最新
- 清华学者用 GPT 证明优化理论 40 年难题 — 新智元 · 2026-08-23
- RiO-DETR:中科大华为清华推首个端到端实时旋转目标检测 — jiqizhixin · 2026-08-23
- 人形机器人转向端到端控制,感知直接驱动运动 — aftahi_ai · 2026-08-23
- Apodex 发布 TRACES 基准,首次评测 AI 科学发现能力 — aftahi_ai · 2026-08-23
- 斯坦福北大新论文:别在世界模型里训练,让 Q-learning 只用它做选择 — rohanpaul_ai · 2026-08-23
- 4B 模型 BFCL 提升 15%,Snowflake 证中期工具学习关键 — TheTuringPost · 2026-08-23