LLaDA-Image 发布:6B 扩散模型全开源训练配方出写实图像
iScienceLuvr · x · 2026-09-04
LLaDA-Image 是一个统一图像生成框架:6B 参数的 Diffusion Transformer 从零训练,搭配基于 LLaDA2.0-Mini 扩散语言模型主干的冻结视觉-语言理解模块。
关键做法:
- 不依赖大规模图文配对数据起步,而是先通过纯图像预训练与中期训练构建强视觉生成先验
- 生成管线共 220M 样本,98% 为真实图像
- DiT 全程使用无参数 RMSNorm + Muon 优化器,保证高效可扩展优化
- 模型可产出高写实图像并精准执行细粒度编辑指令
团队还蒸馏出 LLaDA-Image-Turbo,支持 2-4 步采样的快速推理。训练配方完全开源。
所属事件:蚂蚁 inclusionAI 开源 6B 图像生成编辑模型 LLaDA-Image(4 条相关)→
「多模态」频道最新
- Midjourney 漫画配色心法:每种颜色只干一件事,珊瑚红造压力 — tisch_eins · 2026-09-04
- 用 Seedance 2.5 造「假 DV 纪实感」:完整复刻 2000 年代手持自拍质感 — eyishazyer · 2026-09-04
- 整座城市为保护一朵黑兰花移动遮挡阳光,视频 prompt 公开 — umesh_ai · 2026-09-04
- 同题实测 HappyHorse 1.1 对决 Kling 3.0:作者痛批主流对比评测不公 — kimmonismus · 2026-09-04
- Reddit 用户用 Veo 打造全 AI 出镜的深夜新闻秀 Sunny Nights — presentofai · 2026-09-04
- 港科大广州×腾讯开源 VibeWorlding:对话式端到端搭建 3D 世界 — jiqizhixin · 2026-09-04