Hugging Face 推出 ScenA:单次生成双角色对话与场景音效
multimodalart · x · 2026-08-08
一款名为 ScenA 的全新全能 TTS(文本转语音)模型在 Hugging Face 上发布,被认为“被严重低估”。
该模型基于 LTX 音频生成模块微调,不仅能接受文本描述和两个声音参考,还能在单次生成中直接输出包含两名说话者对话的完整混合音频,甚至能自动配上场景音效。
「多模态」频道最新
- 实测 Claude Opus 生成 ASCII 艺术视频,视觉效果惊艳 — repligate · 2026-08-08
- 纯文本生成电影级视频:杰克船长逼真演绎加勒比海盗 — Only_Voice569 · 2026-08-08
- Midjourney结合Seedance 2.5:森林漫步AI短片工作流 — miilesus · 2026-08-08
- 韩国 AI Hip Hop 被老妈点赞,网友直呼「太离谱」 — yungcontent · 2026-08-08
- RTX 4070 Ti 实测 MiniMax Turbo LoRA 音频驱动视频配置 — harunandro · 2026-08-08
- RTX 3090 实测:SageAttention+ Spectrum 让 MiniMax 推理提速 2.4 倍 — gabxav · 2026-08-08