CLSS 闭环流式生成:单卡 3080 跑任意长音视频

nazgut · reddit · 2026-08-26

视频扩散 Transformer 单次只能生成几秒,朴素的分块条件生成在几百帧后就会因曝光偏差累积导致场景崩塌或噪点放大。Reddit 用户 nazgut 提出的 CLSS(Closed-Loop Streaming Synthesis) 把分块交接当作反馈回路来控制:各块共享一个流式隐空间缓冲(SLB)重叠区,使隐空间内存从 O(长度) 降到 O(重叠),并在块间施加轻量修正来对抗漂移,全程不修改任何 transformer 权重。

作者已在 ComfyUI 开源节点:ComfyUI-LTX2.3-CLSS。实测在单张 3080(16GB 显存)上用 ltx-2.3-22b-dev-UD-Q4KS.gguf 量化模型,完成了多场景连续跟随提示词的文生视频,单块 10 秒;音频部分仍在开发中。

所属事件:CLSS 闭环流式合成:单卡 3080 实现任意时长音视频生成(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →