15 秒音频几秒克隆声音,Cartesia Sonic 3.6 支持 44 种语言

omarsar0 · x · 2026-10-03

Elvis Saravia(omarsar0) 实测了 Cartesia 最新语音模型 Sonic 3.6:用一段约 15 秒的音频在 playground 中克隆自己的声音,几秒内即完成。

克隆的声音随后用他不会说的日语流利朗读了一句话,效果自然。Sonic 3.6 支持 44 种语言,他建议可用这类技术让内容以多语言触达更多受众。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →