ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan
cs.CV
2026-08-05
开放世界出图要查资料、推理、再画。ToolArtist 把搜索和画图都变成统一多模态模型的自主动作,用意图加质量双奖励的 RAD-GRPO 联训。
文生图模型画面好看,但遇到需要复杂语义、多跳推理、长尾知识或时效信息的开放世界任务就出错,关键信息根本不在提示词里,也塞不进静态参数。已有把 agent 引入图像生成的工作要么把搜索到合成的流程写死,要么只让 agent 负责改提示词、把真正的生成甩给外部生成器。两种做法里,「生成图像」都不是模型自己能自主选择的动作。ToolArtist 的论点是:真正的 agentic 出图,推理、调工具、画图必须由同一个策略自主完成。
主干是 Emu3.5,一个原生自回归的统一多模态模型(UMM),文本和图像都用 next-token 预测。工具两个:文本搜索(Google 加 LLM Reader 跨页兜底)和图像搜索(过滤不可下载页、用 LLM Reader 判相关性,返回参考图带来源的摘要)。
第一阶段 SFT。先给一个 teacher agent 装上搜索工具加一个外部图像生成器(gemini-3-pro-image-preview),让它产出多轮 rollout(推理、调工具、观察交替,不是写死的「搜完再画」)。然后一个转换器把每条轨迹改写成 UMM 格式:外部图像生成的工具调用被藏起来,但它生成的图作为原生视觉 token 保留,看起来就像模型自己画的。过滤掉图像加载、分词、超长失败的轨迹,得到 7132 条训练轨迹。这一步的巧妙之处在于让模型相信自己「会画」,而不是知道自己调用了外部生成器。
第二阶段强化学习 RAD-GRPO(Reason-Act-Draw GRPO)。在真实推理轨迹上在线优化整个策略,奖励 R 等于意图奖励加质量奖励的加权(默认各 0.5)。意图奖励判的是最后那段视觉描述 caption 够不够准、够不够可执行(理想生成器照着能不能画出对的图)。质量奖励是个四维世界知识奖励模型:忠实度 0.1、视觉正确性 0.4、文字准确度 0.4、美感 0.1;不需要文字的任务文字准确度回退到 0.5。还加了格式奖励、draw 信号、长度惩罚和「不画图」额外惩罚,防止策略退化成只搜索不画。关键架构点是:生成的图留在多模态历史里,所以画完不结束交互,模型可以检查、再搜、重画。
评测用两个 benchmark:WISE(1000 提示、25 子域,综合图文一致、真实、美感)和 WorldGenBench-Humanities(732 提示,KCS 是知识清单满足度)。
| 指标 | ToolArtist | 对比 |
| WISE 总分 | 0.79 | BAGEL+CoT 0.70、Emu3.5 0.65 |
| WGB-H KCS 均值 | 22.10 | Unify-Agent 15.58、Qwen-Image 21.76 |
在开源里 ToolArtist 是非专有模型最强。但前沿专有模型还领先:WISE 上 Nano Banana 系列 0.89。强项是知识密集的自然类(物理 0.81、化学 0.79),弱项是推理密集的时空类(时间 0.62、空间 0.75)。消融有个扎眼的结果:去掉带来源的图像搜索摘要,WISE 总分从 0.79 掉到 0.61,生物类单跌 0.50,说明模型高度依赖搜索质量。SFT 语料 7132 条,平均 2.05 万 token,平均 4 次工具调用。
对做 agentic 多模态的人来说,把推理、检索、原生生成收进一个策略、并用一套 RL 基础设施训出来,是个可复用的范式,SFT 数据和训练设施都已开源。SFT 阶段「藏工具、留图像」的转换技巧,是把任意 agent 轨迹塞进 UMM 的通用办法。
论文没有独立的局限章节,几个点要打折。只在两个 benchmark 上评,覆盖面窄;时空推理(时间 0.62、空间 0.75)明显弱于专有前沿(0.89),模型在「靠检索」的任务上强、在「靠推理」的任务上弱。严重依赖在线搜索质量,摘要是关键贡献也是关键依赖。没给训练算力、延迟、GPU 时长,「相对便宜」无从核实。RL 奖励来自实时在线搜索轨迹,作者自己承认有可见的波动。