图像生成 agent 也该按需派单:GenRouter 把执行成本砍掉 95%

GenRouter: Unified Workflow Routing for Agentic Image Generation

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

cs.CV

2026-08-17

HKUST 团队把各类 agent 图像生成管线拆成八种原语和模板库,再按提示词的需求画像动态选管线,画质持平或超过 GEMS 的同时,执行成本降 95% 以上、延迟降 65%。

这篇在解决什么

生图模型的像素合成问题基本解决了,现在的麻烦在请求侧。「画一只戴宇航头盔的猫」和「画一张 ICLR 2027 海报,标题精确可读、三个 logo 按左右布局」对管线的要求完全不同。为此学术界造出了一堆 agent 图像生成系统:Mind-Brush 带搜索、GEMS 带验证循环、SCOPE 带技能编排、GenClaw 用代码画布局。

这些系统有两个共病。一是碎片化,每家自建管线,能力无法组合。二是算力错配:固定拓扑意味着简单提示词也要走完搜索、推理、验证全套重流程。论文测得 GEMS 跑 GenEval2 要花 40 美元、8.4 小时,而直接生成的底价是零。GenRouter 的切入点就在这:别让所有请求付旗舰管线的钱。

方法

框架分两层。底层 GenCanvas 把各家管线拆成八种原子原语:Decompose(拆约束)、Search(检索)、Reason(推理)、Skill(调技能)、Sketch(生成 SVG 或 HTML 布局代码)、Verify(对照检查表验证)、Refine(整合成提示词)、Rewrite(失败后重写)。原语组合成四档模板:语义对齐档直接生成或轻量改写;外部接地档先搜索;结构推理档先出布局代码;迭代精修档带验证闭环。GEMS、Mind-Brush、SCOPE 都能映射到具体模板上,这套抽象同时是一个开源代码库。

上层 GenRouter 负责派单,三步走:

执行结果回流记忆,系统越用越准,不需要重训。

结果

主表在五个基准上对比,Z-Image 后端加 Qwen-Image-Edit 的增强版平均分 70.2,GEMS 是 68.5,但成本和延迟差距是量级性的:

方法(30 亿后端平均)平均分成本($)延迟(h)
GEMS68.537.414.0
SCOPE62.73.57.0
直接生成55.100
GenRouter68.13.14.1
GenRouter 增强70.23.04.4

几个诊断值得看。路由分布与基准特性强相关:审美向的 DPG-Bench 九成走轻量模板,带空间与逻辑约束的 OneIG 全谱调用重模板。自进化实验里,依次积累三个基准的经验后,混合测试集分数从 62.5 升到 73.5,成本与延迟同时下降;把 WISE 上蒸馏的经验冻结后零样本迁到 DPG-Bench,得分 87.1,高于 LLM 直接当路由器的 85.9,成本减半。消融显示去掉需求画像退到 70 出头,清空记忆后成本飙到 GEMS 量级,三组件缺一不可。

为什么重要

对做生图产品的团队,这是把 agent 生图从演示推向可部署的关键一步:重流程的能力保留,但只为需要的请求付费。经验路由而非训练策略,意味着换底座模型不用重训路由器,这套思路也容易迁到其他多管线 agent 场景。开源代码库本身把散落的各家管线统一到一个可比较的账本(统一记录 token 与延迟)上,后续研究有现成的地基。

渐进的成分也有:单看画质,提升是几个点的量级,真正的卖点始终是成本与延迟的量级压缩。

局限与存疑

成本与延迟只算路由与原语开销,刻意剔除了图像生成器本身的推理成本,而后者在实际部署里往往才是大头,论文的理由是避免偏袒轻量生成器,但读者换算真实成本时要自己加回去。基准分数做了跨数据集加权归一(WISE 权重 1.12 到 ArtiMuse 的 1.69),「平均 70.2」是校准后的合成数,不是任何单一官方基准分。路由效果依赖冷启动阶段对标基准的穷举探索,换一个全新分布仍要重新积累经验,零样本迁移实验只验证了 WISE 到 DPG-Bench 一条路径。自进化的对比对象是固定管线,没有与持续再训练的模型路由器比。

术语

原文与代码

相关论文

全部论文解读