Sphere Encoder 2 论文:自编码器 1-4 步生成 ImageNet 图像
kastnerkyle · x · 2026-10-03
Tom Goldstein 团队发布 Sphere Encoder 2(arXiv:2610.02208),把自编码器改造成可独立运行的快速图像生成器。论文指出原版 Sphere Encoder 的两大缺陷:一是随机采样的隐变量点在球面上集中于赤道附近,而训练时的旋转覆盖不到该区域,留下限制一步生成的盲区;二是用逐像素重建损失训练生成,会让解码器对多张合理图像取平均,产出模糊、缺高频细节的结果。
Sphere Encoder 2 通过完整覆盖球形隐空间、将重建与生成分离,并结合语义对齐与分数匹配解决上述问题,在保持自编码器速度与简洁性的同时大幅提升生成质量,仅 1-4 步即可在 ImageNet 上取得较强的生成效果。模型已发布,代码即将开源。
「多模态」频道最新
- Codex+MCP 插件约 1 小时复刻 After Effects 动画视频 — CSProfKGD · 2026-10-03
- invideo 推出多轨时间线 AI 视频编辑 agent,一句话批量改镜头 — azed_ai · 2026-10-03
- Krea2 出图普遍偏软?用户实测多种参数仍难解决 — maxiedaniels · 2026-10-03
- 用 VL 模型三问审查视频生成:运动、主体、背景分开校验更精准 — professr_dumbledore · 2026-10-03
- 字节发布 4 步 DMAD LoRA,H3 视频生成再提速 — linoy_tsaban · 2026-10-03
- 本·阿弗莱克自建 8 个月私有影像数据层,让创作者保留所有权 — cen6wkf · 2026-10-03