微软 SkillOpt 用 1 到 4 次验收编辑,把 GPT-5.5 六项均分从 58.8 拉到 82.3

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

Yifan Yang, Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou, Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo

cs.AI, cs.CL

2026-05-23

SkillOpt 把冻结模型的 skill 文档当可训练状态,优化器只做有界增删改,验证集不涨分就拒收。GPT-5.5 直聊六项均分从 58.8 到 82.3(+23.5),Codex 与 Claude Code 再加 24.8 与 19.1 分,52 组全赢或并列。

这篇在解决什么

Agent skill 现在的写法有三种:人手写一份 SKILL.md、让模型一次性生成、或者根据失败轨迹随便改。三种都不像训练:步长不受控,坏编辑直接进部署文件,也没有验证集把关。闭源模型又改不了权重,开源微调又贵。

SkillOpt 的立场很硬:把 skill 文档当成冻结 agent 的外部状态,用另一套优化器模型,按深度学习那套纪律去训。部署时只多一份 300 到 2000 token 的 bestskill.md,目标模型和 harness 都不动。

方法

目标模型带着当前 skill 跑一批训练题,留下轨迹和分数。独立的优化器模型把成功和失败拆开,按 minibatch 做反思,提出结构化的增、删、改。合并去重之后,按文本学习率 Lt 只留下排名最高的 Lt 条(默认 4,余弦衰减到底 2)。候选 skill 必须在 held-out 选择集上严格涨分才被接受,平局也拒。被拒的编辑连同掉分幅度写进 epoch 内的拒绝缓冲,下一轮反思能看见,避免反复踩坑。

每个 epoch 结束还有慢更新:同样的训练题用上一轮和这一轮 skill 各跑一遍,分成改进、回退、顽固失败、稳定成功,写进文档里受保护的慢更新字段,step 级补丁覆盖不了这块。优化器自己另有一份 meta skill,只给老师看,不随部署走。

同一份 bestskill.md 通过适配器接到直聊、Codex CLI、Claude Code。默认 4 个 epoch,rollout batch 40,反思 minibatch 8。

结果

六个基准(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld)×七个目标模型×三种 harness,共 52 个格子,SkillOpt 全赢或并列。对照包括无 skill、人工 skill、一次性 LLM skill、Trace2Skill、TextGrad、GEPA,以及 harness 侧的 EvoSkill。

GPT-5.5 直聊六项平均从 58.8 到 82.3,+23.5 分;逐项挑最强对照的「神谕基线」也只有 76.9,还差 5.4 分。

基准无 skillSkillOptΔ
SearchQA77.787.3+9.6
SpreadsheetBench41.880.7+38.9
OfficeQA33.172.1+39.0
DocVQA78.891.2+12.4
LiveMath37.666.9+29.3
ALFWorld83.695.5+11.9

Codex 上 GPT-5.5 再加 24.8 分,Claude Code 加 19.1 分。七个直聊模型的平均增益约 +17.6;更弱的目标吃得更多:GPT-5.4-nano 的 ALFWorld 从 34.3 到 69.4,DocVQA 从 30.8 到 80.2;Qwen3.5-4B 的表格题从 9.3 到 23.9。

迁移也站得住。GPT-5.4 上训的表格 skill 搬到 mini / nano 仍正增益(+9.4 / +3.0)。Codex 上训的表格 skill 原样丢进 Claude Code,从 22.1 拉到 81.8,+59.7,略超在 Claude Code 里现训的 80.4。OlympiadBench 的 skill 不微调就给 Omni-MATH 的 GPT-5.4 加 3.7 分。

消融里最疼的一刀:拿掉慢更新和 meta skill,SpreadsheetBench 从 77.5 掉到 55.0。拿掉拒绝缓冲,三个基准分别掉 1.6 / 4.6 / 2.4。无学习率约束的整篇重写是 84.6 / 75.7 / 57.3,低于有界编辑。真正写进 bestskill.md 的验收编辑只有 1 到 4 次(中位 2.5);OfficeQA 的 +39.0 和 LiveMath 的 +29.3 各来自一次验收。最终文档 379 到 1995 token。学到的规则是流程而不是刷题:表格题要求先看工作簿结构和公式,再把算好的静态值写满目标区域,而不是指望 Excel 重算。

为什么重要

对闭源模型和不能每换一个领域就微调的团队,这是一条能审计的适配路径:线下用更强优化器烧 rollout,线上只多一份可读的 md。收益集中在流程硬、格式脆的任务(表格、办公文档、答案格式),事实问答的天花板本来就高,涨幅小。EvoSkill 已经能把 Codex 表格从 27.5 拉到 67.5,SkillOpt 再加到 85.0,差的是有界步长、验证门和拒绝记忆,不是「再写长一点」。

这是把 prompt 优化做成受控训练,不是新模型。

局限与存疑

循环依赖自动打分:开放题、主观题、贵的人工评,验证门会失守。训练本身要烧 rollout 和优化器调用,一次性任务不一定划算。一次只训一份领域 skill,异构流程堆在一起可能不够。学到的规则仍带训练集气味,跨很远的模型、harness、任务族仍要 held-out 复查。论文没报优化器 API 的美元成本,只给了训练 token;SearchQA / DocVQA 每涨 1 分要 37.9M / 46.4M token,表格类只要 0.6M。ALFWorld 在 Codex / Claude Code 上留空,因为标准适配器接不住持续具身交互。

术语

原文与代码

社区讨论

相关论文

全部论文解读