ComfyUI 开源 CLSS:16GB 显卡流式生成无限长音视频,DiT 算力省一半
nazgut · reddit · 2026-10-01
Reddit 用户 nazgut 发布了 CLSS(Closed-Loop Streaming Synthesis)的大规模更新,围绕 H3 模型实现任意长的音视频流式生成——H3 单次只能出 5–15 秒,CLSS 用重叠分块接续生成并在交接处控制漂移,不改权重。整套方案可在 16GB 显存卡上跑:int8 DiT、用约 5.5GB 的 Qwen3-VL-4B 替代 15.7GB 的 32B 文本编码器、832×480、约 10 秒分块窗口,作者在 16GB RTX 3080 笔记本上实测。
本次新增的主要能力:
- 多场景提示:每场景一个 prompt(--- 分隔),按比例分配时长,边界两步交叉淡入,globaltext 全场景共享。
- R2V 引用:每场景可绑定图像/音频锚点(<Picture N> / <Audio N>),音频自动切成每场景精确窗口;<Video k> 视频引用自动重采样到 24fps 且自带原声。
- i2v:首帧引导帧钉为 H3 关键帧。
- 音频连续性套件:精确到采样的接缝、波形刷新续写、接缝钉扎(take 穿过接缝生成)、导出期响度锚定(不回灌进条件链)、等功率接缝淡入淡出,以及循环守卫(检测 vamp take 并重掷)。
- 续写与重编辑:从已保存的帧/音频恢复运行,或原地重建单个分块。
- 逐分块神经放大:流式 latent 上采样,低清状态不出显存。
- Spectrum 隐状态预测(CLSSH3SpectrumForecast):改造自 Spectrum 论文,预测步完全跳过 DiT 堆栈,6 步 turbo 分块变成 A A F A F A,约省 50% DiT 计算。
- 16GB 加固:采样前卸载全部模型防 OOM、运行时开启 CUDA 可扩展段。
作者还复盘了最耗时的音频章节:约 2dB/分块的响度泄漏、混叠视频引用等问题逐一修复。仓库:https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS
「多模态」频道最新
- Nvidia 开源 Lyra 2.0:任意图片一秒变成可探索的 3D 世界 — CurieuxExplorer · 2026-10-01
- 用 Nano Banana Pro + h3 做短片的工作流分享,求 LTX 2.5 对应方案 — No_Reference_7678 · 2026-10-01
- Ideogram 4.5 曝光,图像生成赛道再迎新版本 — aziz4ai · 2026-10-01
- MiniMax-H3 被低估:在 ComfyUI 里当图像生成器意外好用 — solomars3 · 2026-10-01
- LEAP 分块检索证据,让小时级音视频问答性能提升最高 16.8% — Juyi Lin · 2026-10-01
- Mac 端 AI 视频剪辑工具 Video Genie 开放早期体验:自然语言直接出成片 — realmeetjames · 2026-10-01