Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation
Jaewon Chu, Ji Soo Lee, Jihwan Park, Dohwan Ko, Jeehye Na, Seunghun Lee, Taehoon Lee, Minseo Yoon, Minseok Joo, Yunyang Xiong, Hyunwoo J. Kim
cs.AI
2026-09-30
公开技能库当先验:RASO 检索加跨 harness 适配,四个 agent 基准全面超越 TextGrad、GEPA,成本砍四成。
Agent skill 是一段可复用的自然语言文档,放进上下文指导 agent 在特定 harness 下完成任务。harness 指执行环境,规定可用工具、文件访问和打分方式。现有优化方法(TextGrad、GEPA、SkillOpt、WikiSkill)把 skill 当文本决策变量,靠训练任务上的 rollout 反馈迭代改写,代价有二:rollout 贵;优化器只能从 agent 自己经历过的轨迹里学,拿不到经验之外的过程知识。与此同时,GitHub 上已沉淀数百万条公开技能(GitSkills 数据集),横跨不同任务、领域和 harness,基本被闲置。
直接检索复用也不行。在 SpreadsheetBench 上检索,92.9% 的命中技能来自别的 harness,只有 7.1% 来自目标环境。检索到的技能带着源领域的名词和工具假设,直接塞进上下文等于注入错误知识:SkillRouter 这类原样复用的方法在多个基准上还不如完全不给技能。
RASO 在优化的两个阶段都插入「检索外部技能库」,共用一条管线。技能文档按标题切成 section,用 BM25 检索,每条查询取 top-5;Cross-Harness Adaptation 再把检索内容改写进目标环境:适配 agent 拿着需求、任务描述、harness 描述和检索到的 section,产出一条简短的 lesson。规则有三:删掉源领域专有名词,目标 harness 没有对应物的步骤直接丢弃;只针对当前需求;关于工具或参数的断言,只有 harness 描述能核实才保留。产出全部用目标环境的对象、命令和单位重新表述。
一个例子:SpreadsheetBench 某任务里,一个部门没有符合条件的行,该单元格应留空。检索到的 top-1 技能来自城市遥感领域,写的是 numpy 栅格数组。适配环节把它的「空组跳过」规则改写成「结果视为缺失」,代码因此留空了那个格子;去掉这条来源,C 部门的均值就被错写进 B 的位置。
RASI 零 rollout:从任务和 harness 描述生成一组「需求-查询」对,逐条检索、适配成 lesson,再由初始化 agent 合成初始 skill。RASU 接 rollout:每轮用当前 skill 跑 minibatch,对失败轨迹生成 textual gradient(自然语言写成的失败批评)加检索查询,适配后的 lesson 连同梯度交给更新 agent 改写,候选版本在验证集赢过现行版本才被接受。
零 rollout 初始化,GPT-5.6-Luna:
| 方法 | OfficeQA | Spreadsheet | ALFWorld | WebShop |
| No skill | 11.44 | 32.98 | 64.43 | 43.56 |
| SkillRouter | 11.44 | 33.21 | 55.97 | 42.20 |
| RFSI(无检索生成) | 40.11 | 44.40 | 69.40 | 43.89 |
| RASI | 45.74 | 49.17 | 72.64 | 45.06 |
Qwen-3.5-9B 上 RASI 对 RFSI 的优势更大,WebShop +10.73(23.27 对 12.54);SkillRouter 在同一设置只有 9.42,连不用技能的 16.27 都不到。
完整优化同样占优:GPT-5.6-Luna 上,RASO 对各基准最强基线分别 +3.49(OfficeQA,49.03 对 45.54)、+6.31(SpreadsheetBench,63.33 对 57.02)、+1.49(ALFWorld)、+1.07(WebShop);Qwen-3.5-9B 上差距放大,ALFWorld +7.47、WebShop +11.30。
消融显示两个组件收益可叠加:无检索的 RFSI+RFSU 在 OfficeQA/Spreadsheet 上是 40.70/51.67,只换 RASU 到 47.56/61.07,只换 RASI 到 45.93/58.45,全用到 49.03/63.33;Cross-Harness Adaptation 单独贡献 +3.88 到 +7.74 分。检索条数 K=5 最优,K=10 反而掉。成本上,RASO 在四个基准中的三个上 API 花费最低,比 TextGrad 省 42-75%(WebShop 10.28 美元对 41.03 美元),rollout 数量与 TextGrad、WikiSkill 相同。
RASI 单独拿出来就是新任务的冷启动方案,零 rollout 换来约 5 个点的提升,可直接用。公开技能库这块免费资产第一次被系统接进优化循环,语料只开放 1% 就有收益、越全越好,远没挖完。同等 rollout 预算下总成本更低,一次优化只要几美元到几十美元。冷水也要泼:方法不复杂,BM25 加一个适配 agent,门槛在语料质量和 harness 描述的准确度上。
论文没有单独的 limitations 小节,以下部分是读出来的。去污染只靠关键词:语料来自公开仓库,可能混入专为评测基准写的技能,作者按基准名和数据集名建 blocklist、整仓库剔除,但挡不住不点基准名的专用技能。harness 描述由 coding agent 读环境代码一次性生成后固定,写错会顺着「可核实才保留」原则直接传导进适配环节。训练集只有 39 到 80 个任务,优化只跑 2 个 epoch,更长日程下组件收益是否保持没有验证。部分优势接近噪声:GPT-5.6-Luna 上 ALFWorld +1.49、WebShop +1.07;TextGrad、GEPA 在 SpreadsheetBench 上还把初始 skill 改差了,基线不稳也放大了 RASO 的相对优势。