蚂蚁 LLaDA-Image 开源:九成样本不带文本预训练,中英文双榜开源第一
机器之心 · wechat · 2026-09-07
InclusionAI 发布并全栈开源文生图与图像编辑统一模型 LLaDA-Image,核心是从零训练的 6B 单流 DiT,配合 LLaDA2.0-mini 扩散语言模型负责理解,一套权重同时支持文生图与指令编辑。
核心方法:「先学会画,再学会听话」
- 2.2 亿累计生成训练样本中超 90% 采用纯图片监督:预训练阶段不使用 caption,图像经随机遮挡补全同时充当条件与生成目标,直接建立视觉先验;图文对集中用于后续 SFT 的语言对齐。
- 训练共六阶段:理解骨干 CoT 微调 → 纯图像预训练与中期训练 → 图文对齐与高分辨率迁移 → T2I/I2I 1:1 联合训练 → TwinFlow 蒸馏。
- 工程细节:全 DiT 使用无可学习参数的 RMSNorm 解决长程训练的尺度漂移;优化器采用 Muon;TwinFlow 用同一 DiT 主干「正时间生成、负时间跟踪学生分布」,将 50 步推理压缩到 2—4 步。
成绩:Qwen-Image-Bench 中英文总分 53.53/53.38,开源模型双榜第一,介于 GPT-Image 1 与 Imagen 4.0 Ultra 之间;LongText-Bench 中英文 0.923/0.913,GEdit-Bench 编辑 7.336/7.294。计数能力(GenEval 0.53)是明确短板。
权重(含 FP8 与 Turbo 版)、训练推理代码和完整数据配方均已开放(GitHub/HuggingFace/魔搭)。
「多模态」频道最新
- Figma Weave 节点画布:多 AI 模型与专业修图工具一站式编排 — gizakdag · 2026-09-07
- 「如果 GTA 发生在纽约」:AI 生成视频走红 Reddit — tres_pares · 2026-09-07
- GPT-6 Astra + Magnific MCP 一条工作流产出电影感广告与落地页 — charis_ai · 2026-09-07
- AI 像人一样开 Blender 引争议:该生成文件还是操作软件? — AIandDesign · 2026-09-07
- 乐谱转 MIDI 再喂模型:结构化表示优于音频扩散方案 — felpix_ · 2026-09-07
- RTX 3090 上 112 组测试寻找 MiniMax H3 最佳参数组合 — badincite · 2026-09-07