LingBot-Vision: Self-supervised ViT backbones via masked boundary modeling

tom_doerr · x · 2026-08-23

LingBot-Vision introduces a family of self-supervised Vision Transformer backbones for dense spatial perception, ranging from ViT-S/16 to a 1.1B-parameter ViT-g/16.

Key Features:

The repository includes code, examples, and an accompanying paper.

Original post →

More from Research

Research channel →