Scenema Audio 发布 ComfyUI 原生节点,8GB 显存即可运行
a__side_of_fries · reddit · 2026-08-06
Scenema Audio 现已推出原生 ComfyUI 自定义节点,通过对模型进行量化,使其最低可在 8GB 显存上运行,解决了此前因全精度 Transformer 过重而难以本地部署的问题。
核心特性:
- 支持富有表现力的文本转语音(TTS)与零样本声音克隆。
- 允许通过文本描述情绪(如愤怒、悲伤),并支持内联舞台指令(如 [he laughs softly]),模型会在指定位置精准执行表演。
- 内置 12 种涵盖不同口音、年龄和情感声线的预设声音。
部署与限制:
- 需先下载约 30GB 权重,文本编码器采用 Gemma 3 12B(需接受 HuggingFace 许可协议并配置 Token)。
- 作为扩散模型,部分种子可能产生重复或乱码,建议采用“生成-挑选-修剪”的后期工作流。
所属事件:Scenema Audio 节点支持 8GB 显存运行(2 条相关)→
「多模态」频道最新
- 社区呼吁 MiniMax H3 模型登陆 Apple Silicon — sockenull · 2026-08-06
- Hailuo H3 模型联手 Adobe AE:推全新 AI 插件实现视频内生成与替换 — aziz4ai · 2026-08-06
- 开发者构建本地多模态系统,用个人数据生成专属音视频 — Merzmensch · 2026-08-06
- 视频生成模型实测:Seedance 2.5 对比 Minimax H3 — LudovicCreator · 2026-08-06
- 单张图片生成AI商业广告:完整制作工作流分享 — Gullible-Goose-1992 · 2026-08-06
- 我不和你玩了:AI视频生成的离谱翻车现场 — Superb-Painter3302 · 2026-08-06