Meta releases Muse Voice Transcribe, a real-time audio perception model

bowenc0221 · x · 2026-09-02

Meta Superintelligence Labs introduces Muse Voice Transcribe, their first real-time audio perception model. It delivers streaming ASR, diarization for 20+ speakers, and endpointing. The model features multilingual code-switching and improved accuracy via language, keyword, and context biasing. It ranks first on ArtificialAnalysis's streaming speech-to-text and public diarization benchmarks.

Related event: Meta Launches Muse Voice Transcribe, Claiming SOTA Streaming ASR(10 posts)→

Original post →

More from Models

Models channel →