Flux1 图生 WAN2.2 短片后,如何拼成15秒以上长视频

wreck_of_u · reddit · 2026-08-24

一位 ComfyUI 用户详细描述了自己的角色视频生产管线:夜间用无头服务器批量生成 Flux1 角色图像(基于可靠的角色 LoRA),白天人工筛选掉肢体崩坏和相似度低的结果,再用 Replicate、Vast 等平台从优选图像生成 5-7 秒的 WAN2.1/2.2 片段。

他的核心问题是:能否把这些短片段「拼接」成 15 秒以上的长视频,并让 AI 无缝补全转场?是用静帧还是短片段作输入更合适?或者应该基于现有图像/视频训练新的 LoRA 来直接从文本生成更长视频?他还在追问现在该用什么工具,提到了 Minimax H3。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →