Wan 2.2 声图生视频 ComfyUI 工作流教程
CryptoCatatonic · reddit · 2026-07-16
本教程详细演示了如何在 ComfyUI 中搭建并使用 Wan 2.2 S2V(声图生视频)模型的工作流。 核心工作流功能包括: - **多模态输入**:支持结合参考图像与视频素材进行生成。 - **语音同步**:集成 Kokoro 文本转语音模型,实现视频角色的精准对口型。 - **动作控制**:利用 DW Pose 实现更精细的角色动作控制。 - **特效拓展**:介绍了如何在不破坏原模型口型同步的前提下,生成超出参考图原本视觉效果的额外画面。
所属事件:Wan 2.2声图生视频ComfyUI实战教程发布(2 条相关)→
「多模态」频道最新
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21