StableVQ 论文拆解向量量化训练不稳根源,提出三项无需新参数的修正
Kwai-Kolors · hf · 2026-09-23
快手 Kwai-Kolors 团队发布 StableVQ,针对离散视觉 tokenizer 训练稳定性这一关键而少被研究的问题给出系统性方案。
问题诊断
- VQ 是支撑现代自回归与 masked 图像生成模型的核心;共享投影码本虽大幅提升码本利用率,但训练稳定性仍是短板。
- 作者认为根因在于 Encoder–Decoder 与 Codebook 训练目标的纠缠:两者单独都难以可靠完成自己的职责,系统只能靠双方「恰好配合」运转,训练压力最大时最容易崩溃。
三项修正
- Dynamic STE:修正 Encoder 学习目标的不稳定性,使其在码本利用率低时也能在离散正则下稳健优化重建空间。
- Region VQ Loss:重构 Codebook 的学习目标,使其独立保证对编码器输出分布的全量追踪,不再依赖编码器振荡来驱动激活。
- Decoupled Schedule:承认两个子系统需要不同优化动态,分配各自独立的学习率调度。
结果:方法基于共享投影码本,轻量且不引入可学习参数;在 ImageNet 上于多种码本规模与初始化设置下,训练稳定性、码本利用率和重建质量均一致提升。
「多模态」频道最新
- 《魔戒》肌肉版爆改:AI 视频把护戒联盟全员练成猛男 — iquizuanswer · 2026-09-23
- 焊膏回流焊接视频交给 AI 剪辑:自动分章还纠正口误 — debreuil · 2026-09-23
- Comfy Desktop 上线性能测试功能,可本地基准对比 ComfyUI 工作流 — Lexius2129 · 2026-09-23
- 创作者用海螺 MiniMax H3 做出复古风音乐短片「地水火风」 — TheChuckTone · 2026-09-23
- Swarm 推出 Qwen Image-2.1 推理引擎:1K 图生成仅 0.5 秒 — bingxu_ · 2026-09-23
- Gemini 图像生成迭代编辑失效,追问修改整图重绘 — asm99 · 2026-09-23