AdsWorldEngine: A Self-Evolving Conversational Advertising Agent through Orchestrator and Tool Coevolution
Simiao Zuo, Chenhui Xu, Yimeng Jia, Qiang Lou, Jian Jiao, Denis Charles
cs.IR, cs.AI
2026-08-14
微软对话广告框架 AdsWorldEngine 让 Orchestrator 与工具互相迭代优化,离线相关性提升 80%,Copilot 线上 A/B 测试 RPM 提升 22%。
搜索广告能用一句查询词直接匹配广告,对话式广告没有这个便利。用户在多轮对话里的商业意图往往是隐含的、被上一轮回复带出来的,比如助手推荐了一家咖啡机之后用户问「有没有便宜点的」。系统不仅要判断该不该插广告(太频繁会让用户反感,该出手时不出手又浪费商业机会),还要把这个隐含意图转成检索词、调用广告工具、挑出最相关的几条,全程没有明确的查询词可用。此前的研究大多只做了这个链条里的一段,比如只研究广告文案生成,或只研究插入时机,没有端到端把整个投放流程当一个系统来优化。
AdsWorldEngine 分四个组件串联:
核心贡献是一套「Orchestrator 和工具交替迭代」的训练循环:先用监督微调加 Evaluator 打分的强化学习(GRPO)训练 Orchestrator,再把 Orchestrator 训练过程中产生的高分和低分 rollout 转成偏好数据,去训练检索/相关性/排序工具本身。这样一轮下来,Orchestrator 学会了怎么用工具,工具也学会了从被奖励的行为里改进自己,循环往复。
判断广告合不合适这类主观决策,论文提出「label grounded judgment modeling」:先定 annotation guideline,人工标注 3 万条对话,再让 GPT-5 依据 guideline 和人工标签生成一段推理轨迹,用 reflection 步骤剔除推理和标签矛盾的样本,最后用一种代价敏感的 GRPO 变体训练判断模型。这个 GRPO 变体去掉了标准 GRPO 里按组内标准差缩放奖励的做法,只做组内中心化,目的是保留「假阳性代价大于假阴性」这种不对称的原始奖励差距,不被标准差缩放抹平。
| 环节 | 对比 | 结果 |
| Opportunity Gate(SFT+代价敏感GRPO vs GPT-5 提示词判断) | ΔFPR / Balanced Acc | -39.07% / +2.51% |
| Evaluator 相关性判断(SFT+GRPO vs GPT-5 提示词) | ΔFPR / Balanced Acc | -12.71% / +7.51% |
| 离线整体(vs 现有生产系统) | 多样性 / 相关性 | +60% / +80% |
| 线上 20 天 A/B 测试(Microsoft Copilot) | RPM / 广告覆盖率 | +22% / +74% |
有个对照实验说明了强化学习和纯 SFT 的差别:只用 SFT 训练的 Opportunity Gate 会把 FPR 压得太狠(降 75.42%),代价是 TPR 也跟着掉了 17.19%,balanced accuracy 反而下降 4.09%;而 SFT 加代价敏感 GRPO 训练出的模型,FPR 降 39.07% 的同时 TPR 基本不变(0.00%),balanced accuracy 提升 2.51%,说明 SFT 只是学到了推理话术的表面模式,GRPO 才把决策边界调到了生产需要的那个点上。
案例分析里有个直观例子:用户在问该选哪个色号,助手正在教用户怎么找到自己的肤色对应色号。GPT-5 提示词判断和只经过 SFT 的 AdsWorldEngine 都把它误判成「用户在选购」该出广告,只有经过完整训练的 AdsWorldEngine 认出这是助手在直接帮用户完成任务,插广告只会打断体验,正确地不触发。
这是少数把「要不要插广告」「插什么广告」「怎么让工具变得更好」三件事放进同一个训练闭环、并且真的上线跑过 A/B 测试的系统。它验证了一个更通用的思路:强化学习产生的偏好数据不只能优化最终决策模型本身,还能反过来喂给它调用的下游工具,让整个复合系统一起变强,不是分别优化各个模块再拼起来。对做对话式 Agent 系统(不限于广告场景)的团队,这套「Orchestrator-工具交替训练」的模式和「用生产标签生成推理轨迹再过滤」的判断建模方法都可以直接参考。
论文标注为「work in progress」,没有给出训练数据规模之外更细的模型架构和超参数细节,也没有公开代码。Opportunity Gate 和 Evaluator 都单独训练在各自的 3 万条标注上,这类主观标注的一致性(标注者之间的 agreement)没有报告,判断标准是否会随产品策略变化而漂移也没讨论。离线评测的多样性指标只基于三条广告位内部的两两余弦相似度,没有和真实用户满意度做交叉验证;线上 A/B 测试的样本量、置信区间、以及是否分了不同人群做子群分析,论文也没有披露。