Reddit 用户称 LTX 2.3 音频比 TTS 更会做呼吸、笑声和语调变化

cptrios · reddit · 2026-07-23

这位 Reddit 用户说,传统 TTS 和声音克隆流程在真实感细节上仍然不够好,比如呼吸、叹息、复杂的语调转折、笑声、呻吟等。

他表示自己试过后发现,LTX 2.3 的音频引擎在生成这些声音上明显更强,配合 ID-LoRa 工作流,已经能在参考音色里做出比较像样的笑声等效果。

他现在想找的是:有没有人做出过一种 LTX / ID-LoRa 的 speech-to-speech 工作流,可以把自定义录音转换成另一种参考音色,同时尽量保留这些逼真的音频表现。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →