ToolArtist:让统一多模态模型像 Agent 一样生成图像
Jiahao Zhao · hf · 2026-08-06
现有文生图模型在处理复杂语义和外部知识时存在局限。本文提出 ToolArtist,一个通过后训练统一多模态模型(UMM)获得的全自主图像生成智能体。
- 统一策略:在单一策略下动态编排推理、外部工具调用(如搜索)和原生图像生成。
- 训练方法:SFT 阶段引入教师智能体收集轨迹并转化为 UMM 兼容格式;RL 阶段开发了 RAD-GRPO 算法,利用意图和质量奖励联合优化模型。
- 实验效果:将整个开放世界图像生成过程置于智能体策略下,效果全面超越固定流程或局部控制的方法。作者开源了训练数据和完整后训练基础设施。
「多模态」频道最新
- Seedance 2.5 淘汰盲抽:1-2 次生成可用长视频 — SarahAnnabels · 2026-08-06
- MiniMax H3 模型实测:生成高质量黑帮动画 — turkey_is_dead · 2026-08-06
- MiniMax H3 进阶影视工作流:从提示词到剪辑 — Tricky_Algae2625 · 2026-08-06
- 网友实测 LTX 放大器:低显存跑高分辨率图像 — AniZeee · 2026-08-06
- 马斯克宣布推出 Grok Imagine 图片生成功能 — elonmusk · 2026-08-06
- Meta 揭示多模态预训练机制:仅用 5% 算力实现强劲生成 — facebook · 2026-08-06