TFO: MBZUAI Brings Speech-Centric Omni Understanding to Frozen VLMs Without Retraining

MBZUAI · hf · 2026-09-07

TFO enables frozen vision-language models to perform speech-centric audio-visual understanding via modular transcript routing, requiring no retraining or architectural changes.

Original post →

More from Multimodal

Multimodal channel →