Mistral放出可本地跑的24B音频模型,短语音转写超过GPT-4o mini

Voxtral

Alexander H. Liu, Andy Ehrenberg, Andy Lo, Clément Denoix, Corentin Barreau, Guillaume Lample, Jean-Malo Delignon, Khyathi Raghavi Chandu, Patrick von Platen, Pavankumar Reddy Muddireddy, Sanchit Gandhi, Soham Ghosh, Srijan Mishra, Thomas Foubert, Abhinav Rastogi, Adam Yang, Albert Q. Jiang, Alexandre Sablayrolles, Amélie Héliou, Amélie Martin, Anmol Agarwal, Antoine Roux, Arthur Darcet, Arthur Mensch, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clémence Lanfranchi, Darius Dabert, Devendra Singh Chaplot, Devon Mizelle, Diego de las Casas, Elliot Chane-Sane, Emilien Fugier, Emma Bou Hanna, Gabrielle Berrada, Gauthier Delerce, Gauthier Guinet, Georgii Novikov, Guillaume Martin, Himanshu Jaju, Jan Ludziejewski, Jason Rute, Jean-Hadrien Chabran, Jessica Chudnovsky, Joachim Studnia, Joep Barmentlo, Jonas Amar, Josselin Somerville Roberts, Julien Denize, Karan Saxena, Karmesh Yadav, Kartik Khandelwal, Kush Jain, Lélio Renard Lavaud, Léonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Marie Pellat, Mathilde Guillaumin, Mathis Felardos, Matthieu Dinot, Maxime Darrin, Maximilian Augustin, Mickaël Seznec, Neha Gupta, Nikhil Raghuraman, Olivier Duchenne, Patricia Wang, Patryk Saffer, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Philomène Chagniot, Pierre Stock, Pravesh Agrawal, Rémi Delacourt, Romain Sauvestre, Roman Soletskyi, Sagar Vaze, Sandeep Subramanian, Saurabh Garg, Shashwat Dalal, Siddharth Gandhi, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Thibault Schueller, Thibaut Lavril, Thomas Robert, Thomas Wang, Timothée Lacroix, Tom Bewley, Valeriia Nemychnikova, Victor Paltz, Virgile Richard, Wen-Ding Li, William Marshall, Xuanyu Zhang, Yihan Wan, Yunhao Tang

cs.SD, cs.AI, eess.AS

2025-07-18

Mistral用Whisper编码器和自家解码器做出4.7B与24.3B音频聊天模型,英语短语音和Common Voice转写超过闭源对照,32K上下文约能装40分钟,Apache 2.0可本地部署。

这篇在解决什么

语音大模型现在分成两条路。一条是Whisper这类纯转写器,听得准但不会回答问题。另一条是GPT-4o Audio、Gemini 2.5 Flash这类闭源音频聊天模型,能听能答,权重不开放,也很难本地部署。中间缺一块:开源、能聊天、转写还要够强、上下文还要撑得住几十分钟音频。

现成评测也偏科。多数工作只报转写和翻译WER/BLEU,对「听完一段音频做问答、摘要、函数调用」几乎没有统一测试。Voxtral要同时补模型和评测:放出Mini和Small两个Apache 2.0权重,并贡献一套把GSM8K、TriviaQA、MMLU合成语音的理解基准。

方法

骨架是三段。音频编码器直接用Whisper large-v3:128维Mel、50 Hz帧率、固定30秒感受野。超过30秒的音频按块独立编码,位置编码每块重置,块之间相当于分块注意力,再在输出处拼接。短音频仍补零到30秒的整数倍;他们试过取消补零,法语FLEURS WER差0.5个点,最终保留。

50 Hz对解码器太长:30分钟就是9万token。后面接一层MLP适配器,时间上4倍下采样到12.5 Hz。消融里12.5 Hz在识别几乎不掉点的同时,Llama QA比50 Hz还高约1.5个点,他们猜这时每个音频向量携带的信息量和文本token比较接近。再密到6.25 Hz,法语WER会多坏1个点以上。解码器两条线:Mini挂Ministral 3B,总参4.7B(编码器6.4亿);Small挂Mistral Small 3.1 24B,总参24.3B。32K上下文大约能装40分钟音频。

预训练用两种等权模板。重复模板:一段音频后面跟它自己的转写,教对齐。续写模板:音频后面跟下一段文本,并多段交错,教跨模态把话接下去。用<repeat>和<next>消歧。只训重复,Llama QA接近零;只训续写,ASR的WER能到近60%。先冻编码器和解码器、只热身适配器,对理解任务有帮助。后训练用Mistral Large在长音频转写上合成问答、摘要、翻译,再用TTS把文本指令数据转成语音;纯TTS会过拟合合成腔,所以另外从真实ASR数据里切出能靠世界知识回答的问题。转写另开专用token,不必再写提示。对齐阶段上DPO和在线DPO:采样两个回复,把音频换成转写,用文本奖励模型打分。

结果

转写是最硬的数字。Voxtral Small在英语短语音和Mozilla Common Voice的宏平均WER上超过Whisper large-v3、GPT-4o mini Transcribe、Gemini 2.5 Flash和ElevenLabs Scribe。LibriSpeech test-clean上Small是1.53,Whisper large-v3是1.84。SPGISpeech上Small 1.89,Whisper 3.15。长音频Earnings-21/22的10分钟切片上Scribe仍更低(7.39/9.16对Small的9.55/12.48)。FLEURS翻译每个报告的语向BLEU,Small都最高,例如en→fr 57.3,GPT-4o mini Audio 52.7。

理解侧Small和闭源同价位互有胜负:Llama QA 71.7对GPT-4o mini Audio的74.3,Openbook QA 88.4对83.7,合成GSM8K 89.7对90.8。内部SU基准上Small的SFT已经86.61%有用、4.16分;在线DPO提到88.31%和4.38,英语短语音WER从6.31回升到6.50,所以对外Small默认仍是SFT。Mini走在线DPO。文本基准上Small和原版Mistral Small 3.1几乎持平,音频没有明显挤掉文本能力。

模型LS-clean WERSPGI WERSU有用率
Whisper large-v31.843.15
GPT-4o mini Transcribe1.924.51不支持转写
Gemini 2.5 Flash2.974.0088.64%
Voxtral Small1.531.8986.61%(SFT)

为什么重要

这是目前少数能本地跑、许可证宽松、转写和聊天绑在同一套权重上的开源音频模型。32K上下文把「上传四十分钟会再问」从工程拼装变成模型能力。函数调用也接到音频上,做语音agent少一截级联。合成语音版MMLU/GSM8K/TriviaQA是社区缺的评测件,他们开源了。

它仍然是级联思想的变体:Whisper听、Mistral想、文本出。讨论帖里Mistral音频负责人也说实时语音仍走级联。Voxtral证明这条路在24B规模已经能打过同价闭源转写,但没有解决全双工和副语言。

局限与存疑

阿拉伯语Common Voice上所有模型WER都超过45%,Small仍约62%,宏平均只好把阿拉伯语拿掉。内部SU基准用「看转写的文本LLM」当裁判,奖励模型和评委都看不见原始音频,副语言、口音、环境音这些维度被设计排除了。在线DPO提高回答质量会轻微伤害英语短语音WER,Small因此不发DPO权重。补零、分块编码、合成问答,全是工程折中,论文没有证明换更新的音频编码器能再涨多少。和GPT-4o、Gemini的对比发生在特定价格档和特定测试集,不能读成全面超过闭源音频模型。

术语

原文与代码

社区讨论

相关论文

全部论文解读