Mistral语音模型延迟仅70毫秒,成其首个闭源模型
shashib · x · 2026-08-08
Mistral 近期推出了其首款文本转语音模型 Voxtral TTS,试图将语音打造为企业指挥 AI 智能体的核心交互界面。
据分析文章披露的关键数据:
- 70 毫秒:在处理 10 秒的语音样本时,该模型声称的延迟低至 70 毫秒。
- 9.7 倍实时率:意味着语音生成的速度远超音频本身的播放时长。
- 3 秒:实现零样本语音克隆仅需 3 秒的参考音频。
值得注意的是,Voxtral TTS 也是 Mistral 首个选择不进行完全开源的模型,这反映出其在开源策略上的微妙转变。
「公司和人」频道最新
- Grok 生态加速:图像模型登顶,Grok Build 月访问破百万 — XFreeze · 2026-08-08
- 无教师 AI 私校 Alpha School 将扩至 50 个校区 — 4KTV · 2026-08-08
- 曝 OpenAI 等头部实验室因政府干预受限,或集体反击监管 — haider1 · 2026-08-08
- 曝 DeepMind 创始人 Hassabis 曾想离职,Google 为稳股价将其转任董事长 — firstadopter · 2026-08-08
- 印度马邦政府部署 Sarvam AI:约2500名官员将用上本土AI工具 — RoboBalaji · 2026-08-08
- AI简报:谷歌高层动荡、Meta发布新Agent、Anthropic自研芯片 — The AI Daily Brief · 2026-08-08