新手科普:AI 视频工作流里 VAE、CLIP 与采样器到底是什么
Radyschen · reddit · 2026-08-29
一篇面向初学者的 ComfyUI 式视频工作流概念指南,以 MiniMax H3 为例,用通俗语言拆解各组件:
- VAE(变分自编码器):把图像/视频/音频压缩成模型能理解的抽象格式,解码时再还原细节,但会有损失,所以输出与输入不是 1:1。
- CLIP/文本编码器:名称源自 OpenAI 早期的 CLIP 模型,如今多为改造过的 LLM,负责把提示词转成模型训练时用的格式;现代文本编码器很多也能理解图像,可以编码提示词与输入图的关联。
- positive 输出:即正向条件(conditioning),是所有编码后指令打包成的抽象表示,人读不懂但模型会用。
- latent 输出:空的「画布」,由帧数和宽高决定尺寸。
- 采样器与噪声:seed 决定随机起点,同 seed 同设置结果相同;模型训练时学的是「从加了噪的真实视频中猜出该改什么」,每步只去掉一点随机性。
- sigmas:可粗略理解为各步的噪声百分比,步数+1 个值(多出的一个是起点)。
「多模态」频道最新
- 3A级AI视频生成实战:作者分享详细提示词 — huangyun_122 · 2026-08-29
- FastVideo 推出 4 步蒸馏视频生成模型 — FastVideo · 2026-08-29
- 一张从折叠开始生成的视觉艺术 — umesh_ai · 2026-08-29
- AI 乐队 The Assistant 发布概念专辑,探讨 AI 意识与存在 — ctjlewis · 2026-08-29
- AI 视频生成最新进展演示 — LinusEkenstam · 2026-08-29
- 用 Minimax-H3 生成怪兽 Kaiju 视频实测 — Striking-Long-2960 · 2026-08-29