LeAVJEPA: Minimal Audio-Video Self-Supervised Encoder Hits AudioSet 36.0 mAP

Aalto University's Arno Solin team introduced LeAVJEPA, the first audio-video self-supervised encoder built on LeJEPA's collapse-free objective. It uses a single shared Transformer encoder and reaches 36.0 mAP on AudioSet in frozen evaluation.

2026-10-08 ~ 2026-10-08 · 2 related posts