ComfyUI 开源 CLSS:16GB 显卡流式生成无限长音视频,DiT 算力省一半

nazgut · reddit · 2026-10-01

Reddit 用户 nazgut 发布了 CLSS(Closed-Loop Streaming Synthesis)的大规模更新,围绕 H3 模型实现任意长的音视频流式生成——H3 单次只能出 5–15 秒,CLSS 用重叠分块接续生成并在交接处控制漂移,不改权重。整套方案可在 16GB 显存卡上跑:int8 DiT、用约 5.5GB 的 Qwen3-VL-4B 替代 15.7GB 的 32B 文本编码器、832×480、约 10 秒分块窗口,作者在 16GB RTX 3080 笔记本上实测。

本次新增的主要能力:

作者还复盘了最耗时的音频章节:约 2dB/分块的响度泄漏、混叠视频引用等问题逐一修复。仓库:https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →