把Agent Skill写成带分支的流程图再进化,GraphSkillEvo平均高出SkillOpt 4.01分

GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills

Rui Sun, Zhi Zheng, Zhenkun Wang, Zhichao Lu

cs.LG

2026-09-18

港城大等把Agent Skill做成节点加条件边的流程图,再用种群进化做变异和交叉。无harness的GPT-5.4-nano上平均准确率比SkillOpt高4.01分,SpreadsheetBench从50.11升到60.71。

这篇在解决什么

Skill 是给 LLM Agent 的一段可复用流程说明,换模型时不必重训参数。现有优化(以 SkillOpt 为代表)把 Skill 当成没有结构的长说明书,靠单条轨迹反思打补丁。两个后果:小模型跟不住又长又散的清单,不知道当前该看哪一条;无约束自然语言的搜索空间巨大,意思相近的流程能写出无数文本变体,优化器在换措辞。

这篇把 Skill 画成流程图,再在图结构上做种群进化,交叉不同候选里好用的节点和边。

方法

图结构 Skill 含全局指导 hs 和有向图 gs。节点是自带规则的执行步骤(解析目标、取证、操作、校验);边来自多条 workflow,每条有适用条件 cm 和节点序列 pm,同一节点可被多条路径共用。

GraphSkillEvo 种群大小 N=4,进化 T=5 代。每代从训练集抽 15 条实例,每个个体最多留 5 条失败轨迹。四个算子轮转:

父代按适应度名次抽样,概率正比于 1/(rank+N)。新个体在完整验证集上打分,与当代合并后留分最高的 N 个。优化期间只改 Skill,LLM 参数和 harness 不动。同一套 LLM 既执行任务也生成新 Skill。

对照是无 Skill、专家手写、LLM 一次性生成、以及 SkillOpt。基准覆盖 SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench、ALFWorld。每项三轮优化取平均。Codex harness 下 ALFWorld 留空,因为标准适配器撑不住持续环境交互。

结果

测试集成功率,无 harness:

模型来源SearchQASpreadsheetDocVQALiveMathALFWorld平均
GPT-5.4无 Skill77.5039.1679.0533.6073.1360.49
GPT-5.4SkillOpt82.2164.8789.3047.5886.5674.10
GPT-5.4GraphSkillEvo83.8069.4090.3748.6587.0675.86
GPT-5.4-nano无 Skill58.1235.1236.7223.9341.2939.04
GPT-5.4-nanoSkillOpt69.5250.1177.8029.5657.4656.89
GPT-5.4-nanoGraphSkillEvo72.9360.7180.9228.7661.1960.90

相对 SkillOpt,无 harness 平均 +1.76(GPT-5.4)和 +4.01(nano);Codex + GPT-5.4 再 +1.33。14 个模型–harness–基准组合里 13 个第一。唯一落后是 nano 的 LiveMath,比 SkillOpt 低 0.80。手写和一次性 LLM Skill 在 Spreadsheet 上经常低于无 Skill。

把优化好的图拆掉 workflow、只留全局指导和节点文案,nano 上 SearchQA / Spreadsheet / DocVQA / LiveMath / ALFWorld 分别掉 4.52 / 2.50 / 4.19 / 1.35 / 0.75 分。在 SearchQA、Spreadsheet、DocVQA 上对 nano 做算子消融,平均从 71.52 降到:无图结构 64.08,无交叉 66.59,无变异 54.50。变异吃掉的是执行反馈,拿掉它塌得最狠。

Token 总量 SkillOpt 是 GraphSkillEvo 的 1.31 倍(GPT-5.4,81.08M vs 61.94M)和 1.36 倍(nano,103.54M vs 75.94M)。nano 上优化出的图 Skill 接到 GPT-5.4,Spreadsheet 到 71.78,超过在 GPT-5.4 上直接优化的 69.40;同一转移下 SkillOpt 只有 53.21。

为什么重要

Skill 优化的瓶颈经常是表示,不在反思次数。小模型更吃结构化流程,Spreadsheet 这种必须逐步对格子的任务差得最开。交叉让种群比单条自我修补走得更远,而且总 token 更少,因为搜索空间被图约束住了。

跨模型能搬,意味着可以在便宜模型上搜 Skill、在强模型上用。这是渐进改进,不是新的 Agent 架构:底座和工具不变,变的是那份说明书的形状和搜索方式。

局限与存疑

种群 4、代数 5,搜索很浅,更大种群会不会继续涨没有扫。适应度就是验证集成功率,验证集小或与测试同分布时有过拟合风险。LiveMath 上 nano 输给 SkillOpt,图结构对纯选择题推理帮助有限。Codex 路径没有 ALFWorld。优化默认假设任务有可执行的打分函数和可分的训练/验证/测试,开放世界里这三样都不免费。和参数级 RL 的结合只出现在未来工作里。

术语

原文与代码

相关论文

全部论文解读