Hugging Face 推出 ScenA:单次生成双角色对话与场景音效

multimodalart · x · 2026-08-08

一款名为 ScenA 的全新全能 TTS(文本转语音)模型在 Hugging Face 上发布,被认为“被严重低估”。

该模型基于 LTX 音频生成模块微调,不仅能接受文本描述和两个声音参考,还能在单次生成中直接输出包含两名说话者对话的完整混合音频,甚至能自动配上场景音效。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →