华为 ACE 透镜:Agent 数据先求可执行,再谈难度与覆盖

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu

cs.AI, cs.CL

2026-08-27

华为与交大把 agent 数据拆成环境、任务、轨迹、校验四元组,用准确度、复杂度、多样性约束分布。核心是持续分配有效、有信息量、不重复的经验,堆量本身不够。

这篇在解决什么

LLM agent 要学会调工具、改文件、在模拟器里行动,靠的是交互数据。这类样本跟普通指令微调不一样:环境、任务、轨迹、成功信号必须对得上。一条读起来通顺的对话,可能任务根本做不到,工具实现和文档打架,观察不是前一个动作的结果,或者校验器在奖励错误终点。

现有工作散落在工具调用、仓库修 bug、GUI、模拟器、科学发现等域,按应用场景组织。两件事经常被搅在一起:候选怎么造,和造出来之后怎么验、怎么选。相近机制换个名字出现,不同过程产出的数据又用对不齐的指标汇报。华为诺亚与上海交大这篇综述要给这个领域一套能跨域比较的账本。

方法

数据写成四元组 $(E,q,\tau,v)$。$E$ 是可行动的世界,包括工具、状态、转移规则、观测接口;$q$ 是任务信号;$\tau$ 是一次实现出来的交互;$v$ 是可选校验器。落地格式可以不同,四个角色不能缺。

生成范式按锚点和依赖顺序分。正向生成先有环境,再写任务,再滚轨迹,对接地最好,风险是窄环境会卡住后面所有东西。反向生成包括任务先行(先定能力再补环境和轨迹)、轨迹先行(先探索再反写任务)、结构先行(先有工具图、蓝图或计划再落地)。自适应系统把校验失败和学习反馈送回去改前面的因子。

ACE 把生成看成带约束的分布设计。Accuracy 是准入门:局部合法,并且四个因子互相一致。过了这扇门,Complexity 按声明的学习器和执行配置(模型、脚手架、工具、推理预算)把质量放在可学区间,难度不是越高越好。Diversity 是批次属性,奖励覆盖、惩罚冗余,单位是会改变观察、决策、行动的关系,不是换个工具名或改写一下请求。

结果

这是综述,没有新的对照实验。文献层面能看到三条迁移。

Accuracy 从「看起来像」转向执行落地:真实函数调用、数据库状态、编译测试、证明助手。APIGen 先做格式校验再执行再语义审查;EnvFactory 一类工作用更少但校验更硬的环境,去跟单纯扩环境数量竞争。

Complexity 从静态启发式(长度、工具数、措辞晦涩)转向相对学习者的难度。有用样本往往落在基座模型解不稳、加上 agent 辅助又能解的那条带子上。结构图、信息扣留、环境策略都能加负担,但必须可恢复、可执行,否则只是含糊或装饰。

Diversity 从样本量、域名、表面改写,转向行为覆盖。一张更大的 API 表或更多改写,如果诱导的还是同一套观察-决策-行动,就不算扩覆盖。

讨论部分把 ACE 推到更早的训练阶段和自演化闭环。预训练和中训不必每条都是完整四元组,局部状态转移、逆动力学、可达性目标也能教交互先验。自演化里生成不再是离线备料:失败和覆盖缺口直接决定下一步该经历什么。

为什么重要

做 agent 数据的人如果还在比条数,这篇把账本换成了三件事:这条能不能执行、对当前模型难不难得刚好、跟已有样本是不是同一条行为。SFT 管格式、RL 管策略的分工还在,但生成器、校验器、学习者开始共演化之后,离线堆数据集的做法会越来越不够。

工程上可直接用的顺序是:先把环境和校验器做硬,再谈扩任务;难度跟着模型能力调,不要固定一个「更长更难」的模板;多样性指标要能区分策略覆盖和 rollout 噪声。

局限与存疑

综述没有统一基准去量化 ACE 三轴,多数判断来自对既有工作的归类。Accuracy 的执行信号仍可能被钻空子,安全、意图、长期副作用过不了编译测试。Complexity 的「可学带子」依赖协议和阈值,论文没有给出可迁移的默认值。Diversity 缺少跨域可复用的度量,熵和改写距离都会虚高。自演化闭环里,生成器、学习者、校验器一起漂移时,文中强调需要独立锚点,现有系统几乎都还没把这条做硬。

术语

原文与代码

相关论文

全部论文解读