Scenema Audio 登陆 ComfyUI:8GB 显存即可带跑情感 TTS 与零样本克隆
a__side_of_fries · reddit · 2026-08-06
Scenema Audio 现已作为原生自定义节点接入 ComfyUI,并对模型进行了量化处理,使其能在 8GB 显存(如 RTX 3070)上流畅运行,生成速度最高可达实时的 2 倍。
主要特性:
- 支持零样本声音克隆,用户可通过文本描述指定情绪(如愤怒、悲伤),并利用内联括号提示(如 [he laughs softly])在特定位置插入动作或语气变化。
- 内置 12 种涵盖不同口音、年龄和情感基调的预设声音。
使用须知:
- 首次运行需下载约 30GB 权重,文本编码器采用 Gemma 3 12B(需接受 HuggingFace 许可协议并配置 Token)。
- 作为扩散模型,部分种子可能会产生重复或乱码,更适合“先生成后剪辑”的工作流。通过音标拼写可有效改善专有名词的发音准确度。
所属事件:Scenema Audio 节点支持 8GB 显存运行(2 条相关)→
「多模态」频道最新
- ControlNet 过时了吗?Krea 2 骨架控制展示精准生图 — multimodalart · 2026-08-06
- AI 视频生成实测:重现经典动漫《美少女战士》片段 — VinceTrust · 2026-08-06
- AI 视频生成仍陷恐怖谷:Minimax H3 实测效果引吐槽 — mattshumer_ · 2026-08-06
- Grok Imagine 将引入关键帧支持并升级图像模型 — chaitu · 2026-08-06
- Nano Banana 实用提示词:将任意 Logo 变为逼真厚涂笔触 — azed_ai · 2026-08-06
- 用 6 年前旧显卡本地跑 MiniMax H3,生成 76 段不同风格动画 — PetersOdyssey · 2026-08-06