不对准基准造 4783 个商业世界,4B 的 AIME26 仍涨 10 分

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

Minbyul Jeong, Chanwoong Yoon

cs.CL, cs.AI

2026-08-21

先从商业场景实例化可执行世界,再从世界里长出任务。4783 个环境训 Qwen3.5-4B,EnterpriseOps 从 12.3 到 15.7,AIME26 从 45.9 到 56.0;造世界成功率从 3.3% 拉到 83.3%。

这篇在解决什么

现在训 agent 的环境,多半围着任务搭:先定一道题,再造能跑这道题的模拟器。任务变多,底下的世界不一定变多样。真实工作流反过来。工单、邮件、CRM、库存已经在那儿,任务从正在运转的世界里冒出来。

AgentMercury 把造世界提成一等角色,叫 Planet。输入一段高层商业场景,先实例化可执行世界,再从世界里采样任务。训练环境不对着评测基准造。

方法

Planet 从场景 σ 吐出世界 w:公司身份、服务图、状态 schema、初始状态、世界级不变量。不变量不写进转移函数,转成可执行校验,多半是 SQL,事后检查跨服务约束。上游事件发生后下游必须有记录,环境不会替 agent 自动写那条记录。同一套不变量有两个视图:可见的是环境里的政策文档,agent 得自己翻到;隐藏的是评分器用的确定性断言。

同一世界可以种不同任务种子,换指令和评分表。Agent 只看到工具返回,看不到完整状态。转移由环境执行,轨迹可按动作序列重放,分数确定。

规模上放出 4783 个可执行环境,覆盖 14 个行业、50 个国家。RL 语料用了其中 4326 个公司、43300 条任务,每环境 10 个种子。一共 842 种工具,每世界平均 16.1 个工具,每任务平均碰 2.9 个服务、5.4 条断言;25991 条任务带跨系统动作风险。真正拿到梯度的只有 3200 条任务,约 7.4%,但覆盖了 2313 个环境、638 种工具。

策略侧 4B 用 GRPO,35B 还试了单 rollout 的 SAO。评测走 EnterpriseOps-Gym,再外加 AIME26、HMMT、LiveCodeBench、SciCode、τ³、BFCL、GPQA-Diamond,各跑 3 次取均值。

造世界也能学。用 29823 条构造轨迹微调 Qwen3.5-35B-A3B,监督包括 brief 到世界、中间阶段补全、校验器引导的损坏修复、意图到 diff。held-out 30 个商业 brief,12 个结构校验全过才算成功。

结果

Qwen3.5-4B 加 GRPO 之后,EnterpriseOps-Gym 从 12.3 到 15.7,相对涨 27.6%。Drive 从 6.2 到 15.6,Email 从 23.9 到 33.3。CSM 从 9.2 掉到 5.6,八个域里唯一下跌。35B 用 GRPO 从 24.8 到 28.1,用 SAO 到 28.3,八个域全涨。GPT-5 在该基准是 30.9,训练后的 35B 仍低于它。

域外转移更刺眼,因为这些题从未进入造环境的流程:

基准4B 基座4B+GRPO
AIME2645.956.0
HMMT28.535.4
LiveCodeBench36.644.0
SciCode22.625.7
BFCL30.331.7

35B 上数学已经接近顶,AIME26 从 91.0 到 92.2;工具向的 BFCL 从 31.1 到 42.1。τ³ 上基座方差极大,Telecom 49.1±49.8,SAO 之后均值上升、方差仍不小。训练过程奖励稳步升,截断下降,退化输出接近零。

造世界:Qwen3.5-35B-A3B 零样本成功率 3.3%,微调后 83.3%,和 Claude Opus 4.8、DeepSeek-V4-Pro 的零样本持平。给一份构造配方,基座从 3.3% 升到 20.0%,微调模型从 83.3% 砸到 10.0%,30 个 brief 里 27 个栽在跨服务校验。API 模型零样本大约 66.7% 到 83.3%,配方没有稳定增益。GPT-5.4 在 30 个 brief 里有 10 个把跨服务约束折进同一个服务。

为什么重要

这篇在争一件具体的事:不要围着基准刷环境数量,去扩世界的结构多样性。商业流程自带长程状态、异构工具和跨服务约束,这些交互模式能迁到数学、代码和工具调用。造世界可以从工程流水线变成可学习能力。

数字要放对位置。4B 在 EnterpriseOps 只到 15.7,GPT-5 是 30.9,离能用的企业 agent 还远。更值得盯的是 AIME26 涨了约 10 分,训练环境里没有竞赛题。

局限与存疑

闭环没做成。生成器不会根据 policy 的失败去补场景,也没用世界模型预演候选世界。4B 上 SAO 不稳,被整段拿掉,环境信号对小模型不是算法无关。CSM 掉了 3.6 分,论文没有拆开原因。RL 只用了 7.4% 任务。造世界评测只有 30 个 brief。环境是合成商业软件,不是真的 Salesforce 或 Jira。不变量靠事后 SQL 查,可见政策和隐藏校验是否对齐,没有人评。

术语

原文与代码

相关论文

全部论文解读