SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams
Ao Yan, Xin Zhang, Jiawei Du, Joey Tianyi Zhou
cs.AI
2026-09-02
把每题局部技能按解法家族压成去实例化先验,执行时再补细节;12 组实验硬指标平均比无技能高 17.2 分,库比逐题池小 3.6 倍。
Agent 开始自己写技能、再塞回上下文里复用。技能往哪放,现成两条路:一份不断改写的全局文档,或者按任务一条一条堆的扁平库。结构相近的任务上,两条路都能用;每道题解法差得很远时,两边同时垮。
全局文档被压成「注意边界条件、先读错误信息」这类模型已经会的纪律。逐条库跟着任务线性膨胀,条目绑在写出它的那道实例上,检索过去也带不走。SkillsBench 给过对照:人写的技能能把通过率抬 16.2 分,模型只看题面自己写的,比完全不写技能还低 1.3 分。真正能迁的,是一簇相关任务共享的解题步骤,不是题面,也不是那一次跑出来的路径细节。
GLoW 把技能拆成两层,执行时织在一起,巩固时再拆开。
执行时库冻结。Qwen3-Embedding-8B 用题面检索最相近的家族先验,余弦相似度低于 0.45 就只留一条总是注入的 base prior。先验整场任务不变,局部技能随反馈更新。
四个流:Terminal-Bench-Pro 32 题、SWE-bench Verified 20 题、ALFWorld 42 题、LiveMathematicianBench 53 题。三套冻结模型 DeepSeek-V4-Pro、MiniMax-M3、GPT-5.4-mini,共 12 组持续改进实验。hard 是各榜自己的全对或全错;soft 是部分分,SWE 上乘性,挂掉已通过测试整项归零。
| 设置 | hard 相对无技能 | soft |
| 仅全局先验 | +17.2 | +13.0 |
| 全局+局部再生 | +18.0 | +14.6 |
12 组全是正增益。涨幅最大落在 SWE:MiniMax-M3 加局部后 +30.0 / +27.7,DeepSeek-V4-Pro +25.0 / +25.0。数学端两套模型只 +3.8 和 +5.7,那边任务本来就共享步骤,家族粒度能赚的空间最小。
同一协议下对比单文档优化器 SkillOpt:21 个格子里 GLoW 赢 15、SkillOpt 赢 4、平 2。SkillOpt 的 4 格全在 ALFWorld,那一套动作空间够一份文档概括。Terminal / SWE / 数学上,hard 平均分别领先 8.3、6.7、6.9 分。
组织消融把粒度拧到两端。整库压成一份文档平均只 +2.0,12 格里 4 格退步;只留局部技能 +10.9,仍落后仅全局;按 AWM 风格扁平检索 +5.0,一轮家族巩固就能 +11.2。提交门 26 次决策收 19 拒 7;门留下的库到终轮 +14.7,无条件收下当轮候选只有 +9.6。
未改库直接打 ALFWorld validunseen 60 题,三模型平均 73.9% 到 83.9%。SWE 30 道未见仓库,MiniMax-M3 三次平均 40.0% 到 45.6%。已部署库比逐题池小 3.6 倍。MiniMax-M3 在 ALFWorld 的 42 题上压出 15 条先验,13 条完全落在数据集自己的任务类里。
Agent 技能的问题经常被写成「怎么写出更好的一条」。这篇把粒度钉住:复用单元是解法家族。做长程、异构任务流的人,如果还在维护一份 skill.md 或无限追加的经验条目,对照说明两条路都会在这个分布上失效。
能直接拿去用的部分是组织方式,不是某一个预训练好的库。先验是纯文本,理论上可以换模型接着用,但跨模型继承没测。这是组织上的改进,不是新的训练算法。基座冻结,唯一把手是往上下文里塞什么。
作者自己写了两条:迁移只在任务类别复现的 hold-out 上成立,跨域能不能活着不知道;把一个模型的库交给另一个模型,也没测。
实验体量偏小。四个流分别 32 / 20 / 42 / 53 题,主表每个格子基本是单次 run,SWE 的未见集才三次平均,解码温度 0.7。聚类权重写死,四个榜共用。提交门要额外真跑,省不掉。家族划歪会伤人:最大的 Terminal 家族把调试、WAL 恢复、逻辑门 CRC32 塞进同一条,修 1 破 1,这组里唯一没有净收益的大家族。
主表格子几乎不重复采样,17.2 这个均值不该被读成已经钉死的效应量。