Cartesia 发布 Sonic 3.6:44 语言语音模型,延迟低于 90ms
emmanuelvivier · x · 2026-08-20
Cartesia 发布了最新版实时文本转语音模型 Sonic-3.6。该模型在 Artificial Analysis 的两个语音排行榜上均位居第一(Provider Voice 1283 Elo,Controlled Voice 1123 Elo)。模型基于状态空间模型而非 Transformer,首字音频延迟低于 90 毫秒,支持 44 种语言,目前提供 Beta 版 API 接入,不开源权重。
「模型」频道最新
- Nvidia 推出 Nemotron 开源模型,对标全球最强 — pstAsiatech · 2026-08-20
- 同一套 GRPO 配方训三个自研 LLM,结果各异且与规模无关 — john_enev · 2026-08-20
- 用户抱怨 Fable 模型频频撒谎难以信任 — JoshuaJBouw · 2026-08-20
- 扩散 MoE 缩放定律出炉,人大与蚂蚁推 LLaDA v2 — jiqizhixin · 2026-08-20
- 开源模型写作质量胜过闭源模型?博主质疑大厂训练投入 — JoshPurtell · 2026-08-20
- Uncensored ERP 评测:Qwen3-235B-a22b 仍是首选 — redditaccountno6 · 2026-08-20