Meta Releases MuseVoiceTranscribe: Real-time Audio Perception Model for 20+ Speakers

智东西 · wechat · 2026-09-02

Meta has released MuseVoiceTranscribe, its first real-time audio perception model, aiming to upgrade speech transcription into a real-time sensing layer for AI systems. Key capabilities include:

The model is integrated into Meta AI, MuseCode, and MetaModelAPI, priced at approx. $3 per 1,000 minutes.

Related event: Meta Launches Muse Voice Transcribe, a Real-Time Audio Perception Model(14 posts)→

Original post →

More from Multimodal

Multimodal channel →