蚂蚁 LLaDA-Image 开源:九成样本不带文本预训练,中英文双榜开源第一

机器之心 · wechat · 2026-09-07

InclusionAI 发布并全栈开源文生图与图像编辑统一模型 LLaDA-Image,核心是从零训练的 6B 单流 DiT,配合 LLaDA2.0-mini 扩散语言模型负责理解,一套权重同时支持文生图与指令编辑。

核心方法:「先学会画,再学会听话」

成绩:Qwen-Image-Bench 中英文总分 53.53/53.38,开源模型双榜第一,介于 GPT-Image 1 与 Imagen 4.0 Ultra 之间;LongText-Bench 中英文 0.923/0.913,GEdit-Bench 编辑 7.336/7.294。计数能力(GenEval 0.53)是明确短板。

权重(含 FP8 与 Turbo 版)、训练推理代码和完整数据配方均已开放(GitHub/HuggingFace/魔搭)。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →