用 GPT Image 首尾帧+LTX 做连贯视频,作者想换 Qwen Image 2.1 本地方案
ART-ficial-Ignorance · reddit · 2026-09-24
一位创作者分享了抽象/超现实视频的迭代工作流:在 ChatGPT 图像生成的长上下文里逐帧生成关键帧(描述场景如何演进约 6 秒后的样子),再用首尾帧喂给视频模型(LTX 2.3)生成过渡片段,循环拼接。GPT Image 因对话上下文能理解视觉推进而表现出色,但流程繁琐且有「触手/面条」退化问题。作者想在本地复刻:用一张风格参考图 + 约 5 个历史关键帧 + 场景演进 prompt 驱动 Qwen Image 2.1 生成下一关键帧,再进首尾帧视频模型,并向社区求证 Qwen 在多参考图、风格一致性与长序列连续性上的表现。
「多模态」频道最新
- Dreamina 网页版上线:节点分支工作流免重roll,月费限时 1.5 美元 — Div_pradeep · 2026-09-24
- DeepMind 发布 Gemini 3.8 TTS,原生支持多人对话与插话笑场 — kastnerkyle · 2026-09-24
- 把 AI 视频当流水线:作者在 CREAO 里搭可复用电影级生产 agent — FellMentKE · 2026-09-24
- 开发者自制 ComfyUI 节点,找回模板库被砍的筛选与排序功能 — linus74RN · 2026-09-24
- Gemini 3.8 Flash TTS 演绎「大阪大婶」,语音表现引关注 — heiga_zen · 2026-09-24
- ElevenLabs MCP 发布:语音、音乐、图像、视频生成一站接入 — aftahi_ai · 2026-09-24