Lyria 3.5 可当 TTS 用,一条 prompt 生成逼真口语片段

fofrAI · x · 2026-09-06

fofrAI 发现 Google 的音乐生成模型 Lyria 3.5 有个特别用法:把它当文生语音模型来 prompt,就能得到听起来很真实的原始声音片段。作者给出的示例 prompt 是「一位英国千禧一代女性,语气疲惫、坦率、自然,无歌词、无音乐、无节拍、无打击乐,时长 60 秒」,模型输出了贴近真人语感的口语内容,而非唱歌。这一玩法说明媒体生成模型的底层能力边界比官方定位更宽,值得做语音/音频内容的人实测。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →