Mistral Voxtral TTS 延迟低至 70ms,但未完全开源
shashib · x · 2026-08-06
Mistral 正押注语音交互成为企业控制 AI Agent 的主要接口。在 Ai4 2026 大会上,该公司重点展示了其音频模型 Voxtral TTS。
该模型的核心数据与特性包括:
- 超低延迟:在 10 秒的语音样本上,延迟仅为 70 毫秒。
- 高实时率:生成语音的速度比音频实际长度快 9.7 倍。
- 零样本克隆:仅需 3 秒参考音频即可进行声音克隆。
尽管技术指标亮眼,但 Voxtral TTS 也是 Mistral 唯一没有完全开源的模型,其复杂的授权协议引发了关于其“开源”定义的争议。
「模型」频道最新
- 高强度实测48小时:DeepSeek Flash 稳定性惊人 — yacineMTB · 2026-08-06
- Qwen Max 开源引争议,企业 AI 治理与安全成焦点 — The AI Daily Brief · 2026-08-06
- Boson AI 发布 Higgs Realtime 实时语音模型 — smolix · 2026-08-06
- Together AI 上线 Kimi K3 推理服务,多项基准测试领先 — togethercompute · 2026-08-06
- Liquid AI 2.6B 模型实测:端侧跑速达 90t/s,工具调用翻车 — curiousily_ · 2026-08-06
- DeepSeek用2000块GPU训练出超越谷歌的模型,谷歌Gemini团队陷入困境 — teortaxesTex · 2026-08-06