通义新研究:像素空间扩散模型比 latent 快 4.75 倍
Crazy-Repeat-2006 · reddit · 2026-08-20
阿里通义团队发布论文,探讨了像素空间文本生成图像扩散模型的训练策略。研究发现,直接在像素空间进行大规模预训练收敛较慢。论文提出了一种“从潜空间到像素空间”的策略:先在潜空间高效获取生成先验,再在后期训练阶段转换至像素空间。通过系统调整权重初始化、数据组成等设计,该方案使像素模型性能匹敌或超越潜空间模型,且实现了 3.18 到 4.75 倍的端到端推理加速。
所属事件:通义提出潜空间到像素策略,加速文生图扩散模型(2 条相关)→
「研究」频道最新
- 机器人实现零微调的单次演示模仿 — Scobleizer · 2026-08-20
- 前沿数据实验室 Idler 获 900 万美元种子轮融资 — ycombinator · 2026-08-20
- 利用 r/place 模拟多智能体协作与冲突,仅 0.49% 互相覆盖 — infoxiao · 2026-08-20
- VSIINK:利用 Unicode 变异选择器的隐形墨水编码 — Singularity_Warrant0 · 2026-08-20
- 结合世界模型与 Q-Learning,解锁物理 AI 新能力 — mariyaivasileva · 2026-08-20
- UIST 2026 论文:Compass 系统对齐推荐算法 — shangbinfeng · 2026-08-20