免 refmod 的 ComfyUI 即时参考工作流:带语音的角色视频一键生成
crinklypaper · reddit · 2026-09-12
作者分享了一套接近原生的 ComfyUI 工作流,不用 refmod 或自定义节点即可实现即时角色/风格参考视频生成(含语音),附完整工作流文件和拆解,一键即可运行。
核心做法:
- 把一个文件夹里的图片转为视频帧,作为参考视频喂给模型;也有 grid 版把图片拼成单图参考(作者更推荐视频版)。
- 语音部分:用 VHS 节点喂单个 mp4,或取 4 段片段各截取前几秒干净语音后拼接成 15–30 秒的干净人声片段。
- 使用 KJ nodes、原生节点和 VHS 节点组合;换数据集只需换文件夹,无需管理 safetensors、无需剪辑音频。
- 提示词按 MiniMax-H3 的 ref 语法写,LLM 可代写;若数据集特征渗入生成结果,加更多描述即可抑制。
- 已知问题:ComfyUI 有内存管理 bug,更换数据集后建议清缓存或重启;视频片段作输入尚未测试。四个示例涵盖双角色带语音、不同性别角色、风格与角色参考、纯图像参考。
「多模态」频道最新
- GPT Image 2.5 携手 CapCut:一条从创意到成片的三步 AI 视频工作流 — thetripathi58 · 2026-09-12
- GPT Image 2.5 将登陆 CapCut PC 的 Design Studio 与 AI Image — thetripathi58 · 2026-09-12
- 用 Sprite Fusion API 一条龙生成像素游戏:素材到成品 — HugoDuprez · 2026-09-12
- AI 生成「奶奶游戏」离谱短片走红,展示非常规提示的创意爆发力 — Aiden_Tech_Ai · 2026-09-12
- TesanaAI 推出 image-to-game:任意截图 5 分钟变成可玩游戏 — gabriel1 · 2026-09-12
- 用户实测:Suno 已能基于版权音乐训练生成曲目 — AndyMasley · 2026-09-12