用 GPT Image 首尾帧+LTX 做连贯视频,作者想换 Qwen Image 2.1 本地方案

ART-ficial-Ignorance · reddit · 2026-09-24

一位创作者分享了抽象/超现实视频的迭代工作流:在 ChatGPT 图像生成的长上下文里逐帧生成关键帧(描述场景如何演进约 6 秒后的样子),再用首尾帧喂给视频模型(LTX 2.3)生成过渡片段,循环拼接。GPT Image 因对话上下文能理解视觉推进而表现出色,但流程繁琐且有「触手/面条」退化问题。作者想在本地复刻:用一张风格参考图 + 约 5 个历史关键帧 + 场景演进 prompt 驱动 Qwen Image 2.1 生成下一关键帧,再进首尾帧视频模型,并向社区求证 Qwen 在多参考图、风格一致性与长序列连续性上的表现。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →