Sori-1B: Audio-Grounded LM Trained From Scratch With No Text-Only Pretraining

Balance- · reddit · 2026-08-31

An SNU researcher released Sori-1B, a 1B-parameter audio-language model whose decoder is trained entirely from scratch on audio-paired text, with no text-only pretraining or pretrained-LM initialization.

Technical Highlights:

Original post →

More from Multimodal

Multimodal channel →