北大推出 UniWorld-Design 原生图层生成框架
PekingUniversity · hf · 2026-08-05
北京大学提出 UniWorld-Design 框架,将图像生成从平面的像素合成重新定义为结构化的视觉构成,以具有语义的 RGBA 图层作为生成、理解和编辑的原子单元。
核心模型
- Text-to-RGBA (T2RGBA):直接从文本生成独立的 RGBA 资产。
- Image-to-Layer (I2L):以完成的图像、全局指令和逐层提示为条件,联合生成有序且完整的语义 RGBA 图层。由于学习的是完整的语义对象而非可见像素的分区,其图层在移动或删除时依然可用。
性能表现
- 在 Crello 基准上,I2L 将每层 RGB L1 误差降低了 37%,Alpha Soft IoU 相较 Qwen-Image-Layered 提升了 34%。
- T2RGBA 取得了最高的 CLIP Score,超越了 LayerDiffuse 和 OmniAlpha。
「多模态」频道最新
- 实测AI Agent自主制作纪录片:从脚本到剪辑全自动 — illscience · 2026-08-05
- 开源社区48小时极限整活:MiniMax视频模型降至5GB显存 — ostrisai · 2026-08-05
- 阿里 Qwen3.8-Max 登顶图生网页榜亚军 — rohanpaul_ai · 2026-08-05
- Minimax H3 生成《宋飞正传》交叉剧视频 — Time-Ad-7720 · 2026-08-05
- AI 脑洞视频:老友记与宋飞正传梦幻联动 — Time-Ad-7720 · 2026-08-05
- ComfyUI 性能优化:升级 CUDA 13 与避坑指南 — ayakitodev · 2026-08-05