SonicCaps: 15M-caption audio dataset improves CLAP retrieval and zero-shot classification

serrjoa · x · 2026-09-03

Original post →

More from Multimodal

Multimodal channel →