GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills
Rui Sun, Zhi Zheng, Zhenkun Wang, Zhichao Lu
cs.LG
2026-09-18
港城大等把Agent Skill做成节点加条件边的流程图,再用种群进化做变异和交叉。无harness的GPT-5.4-nano上平均准确率比SkillOpt高4.01分,SpreadsheetBench从50.11升到60.71。
Skill 是给 LLM Agent 的一段可复用流程说明,换模型时不必重训参数。现有优化(以 SkillOpt 为代表)把 Skill 当成没有结构的长说明书,靠单条轨迹反思打补丁。两个后果:小模型跟不住又长又散的清单,不知道当前该看哪一条;无约束自然语言的搜索空间巨大,意思相近的流程能写出无数文本变体,优化器在换措辞。
这篇把 Skill 画成流程图,再在图结构上做种群进化,交叉不同候选里好用的节点和边。
图结构 Skill 含全局指导 hs 和有向图 gs。节点是自带规则的执行步骤(解析目标、取证、操作、校验);边来自多条 workflow,每条有适用条件 cm 和节点序列 pm,同一节点可被多条路径共用。
GraphSkillEvo 种群大小 N=4,进化 T=5 代。每代从训练集抽 15 条实例,每个个体最多留 5 条失败轨迹。四个算子轮转:
父代按适应度名次抽样,概率正比于 1/(rank+N)。新个体在完整验证集上打分,与当代合并后留分最高的 N 个。优化期间只改 Skill,LLM 参数和 harness 不动。同一套 LLM 既执行任务也生成新 Skill。
对照是无 Skill、专家手写、LLM 一次性生成、以及 SkillOpt。基准覆盖 SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench、ALFWorld。每项三轮优化取平均。Codex harness 下 ALFWorld 留空,因为标准适配器撑不住持续环境交互。
测试集成功率,无 harness:
| 模型 | 来源 | SearchQA | Spreadsheet | DocVQA | LiveMath | ALFWorld | 平均 |
| GPT-5.4 | 无 Skill | 77.50 | 39.16 | 79.05 | 33.60 | 73.13 | 60.49 |
| GPT-5.4 | SkillOpt | 82.21 | 64.87 | 89.30 | 47.58 | 86.56 | 74.10 |
| GPT-5.4 | GraphSkillEvo | 83.80 | 69.40 | 90.37 | 48.65 | 87.06 | 75.86 |
| GPT-5.4-nano | 无 Skill | 58.12 | 35.12 | 36.72 | 23.93 | 41.29 | 39.04 |
| GPT-5.4-nano | SkillOpt | 69.52 | 50.11 | 77.80 | 29.56 | 57.46 | 56.89 |
| GPT-5.4-nano | GraphSkillEvo | 72.93 | 60.71 | 80.92 | 28.76 | 61.19 | 60.90 |
相对 SkillOpt,无 harness 平均 +1.76(GPT-5.4)和 +4.01(nano);Codex + GPT-5.4 再 +1.33。14 个模型–harness–基准组合里 13 个第一。唯一落后是 nano 的 LiveMath,比 SkillOpt 低 0.80。手写和一次性 LLM Skill 在 Spreadsheet 上经常低于无 Skill。
把优化好的图拆掉 workflow、只留全局指导和节点文案,nano 上 SearchQA / Spreadsheet / DocVQA / LiveMath / ALFWorld 分别掉 4.52 / 2.50 / 4.19 / 1.35 / 0.75 分。在 SearchQA、Spreadsheet、DocVQA 上对 nano 做算子消融,平均从 71.52 降到:无图结构 64.08,无交叉 66.59,无变异 54.50。变异吃掉的是执行反馈,拿掉它塌得最狠。
Token 总量 SkillOpt 是 GraphSkillEvo 的 1.31 倍(GPT-5.4,81.08M vs 61.94M)和 1.36 倍(nano,103.54M vs 75.94M)。nano 上优化出的图 Skill 接到 GPT-5.4,Spreadsheet 到 71.78,超过在 GPT-5.4 上直接优化的 69.40;同一转移下 SkillOpt 只有 53.21。
Skill 优化的瓶颈经常是表示,不在反思次数。小模型更吃结构化流程,Spreadsheet 这种必须逐步对格子的任务差得最开。交叉让种群比单条自我修补走得更远,而且总 token 更少,因为搜索空间被图约束住了。
跨模型能搬,意味着可以在便宜模型上搜 Skill、在强模型上用。这是渐进改进,不是新的 Agent 架构:底座和工具不变,变的是那份说明书的形状和搜索方式。
种群 4、代数 5,搜索很浅,更大种群会不会继续涨没有扫。适应度就是验证集成功率,验证集小或与测试同分布时有过拟合风险。LiveMath 上 nano 输给 SkillOpt,图结构对纯选择题推理帮助有限。Codex 路径没有 ALFWorld。优化默认假设任务有可执行的打分函数和可分的训练/验证/测试,开放世界里这三样都不免费。和参数级 RL 的结合只出现在未来工作里。