Lyria 3.5 可当 TTS 用,一条 prompt 生成逼真口语片段
fofrAI · x · 2026-09-06
fofrAI 发现 Google 的音乐生成模型 Lyria 3.5 有个特别用法:把它当文生语音模型来 prompt,就能得到听起来很真实的原始声音片段。作者给出的示例 prompt 是「一位英国千禧一代女性,语气疲惫、坦率、自然,无歌词、无音乐、无节拍、无打击乐,时长 60 秒」,模型输出了贴近真人语感的口语内容,而非唱歌。这一玩法说明媒体生成模型的底层能力边界比官方定位更宽,值得做语音/音频内容的人实测。
「多模态」频道最新
- GPT-6 Astra 医学新玩法:3D 人体解剖爆炸视图演示 — nickbaumann_ · 2026-09-06
- SplatBox 新演示:数百万 Gaussian Splat 秒变 Unity 可交互体素世界 — jonstephens85 · 2026-09-06
- VoxCPM 1.5 TTS 开源:同等音色并发成本比 Orpheus 低 4.5 倍 — TheMoonMidas · 2026-09-06
- 用视频做参考生成艺术:MiniMax 实测视频参考比文字更可控 — Alive-Tomatillo5303 · 2026-09-06
- GPT 6 Astra 把空房间变成全可编辑 3D 家装概念,仅 30 秒 — SimplyAnnisa · 2026-09-06
- 8GB 显存跑 MiniMax-H3 口型同步:多镜头渲染 26 分钟教程 — big-boss_97 · 2026-09-06