一份进化的技能文档当跨任务记忆,SkillRise反超最强基线8.5个点

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

cs.LG, cs.AI

2026-07-29

把相关任务排成由易到难的序列,单策略交替解题与改写一份共享技能文档,SkillRise在三个基准上Pass@1领先最强基线2.3~8.5个点。

这篇在解决什么

agent经常遇到彼此相关、但又不完全一样的任务,它们共享同一类解法。比如ALFWorld里不同的 household 任务、ScienceWorld里不同的科学实验。标准agentic RL把这些任务当成一个个独立episode来训,任务之间不传递任何东西;已有的技能学习方法要么只盯着同一个任务反复试,要么走一条多阶段pipeline,把技能抽取、检索、执行这几步拧在一起,工程重且互相牵扯。问题是,跨任务的共性经验没有被显式沉淀下来。

方法

SkillRise把相关任务实例按环境提供的家族元数据,排成由易到难的序列,然后用一个策略(policy)在两种角色间交替。解题角色负责完成当前任务;策展角色负责改写一份技能文档,这份文档会直接传给序列里的下一个任务,是任务之间唯一的信息通道。

策展不是记流水账。策略会重写整篇文档,保留有用的技能、合并成功的操作流程和典型失败模式、删掉只对某个实例有效的细节。关键设计是decoupled credit assignment(解耦的信用分配):解题这一步只看当前任务成没成,策展这一步不看当下,而是用下游任务打折后的累计收益来评估,跨任务折扣因子γ让远期收益也能回传到当前的技能改写。优化用role-aware group-relative,advantage只在同任务族、同序列阶段、同行为阶段的trial之间算。

结果

Qwen3-4B在三个text-based agent基准上的Pass@1:

基准SkillRise比最强基线GiGPO
ALFWorld85.9+2.3
WebShop84.4+7.1
ScienceWorld54.6+8.5

Pass@3上,ScienceWorld到61.0,比专攻单任务反复试的LaMer高14.2个点。两个有意思的scaling现象:一是跨任务test-time scaling,把同一批128个held-out任务切成长度K的相关序列、每个只做一次,K从2增到6时成功率从83.6升到87.5,和单任务baseline的差距从3.9拉大到8.6个点,说明涨的是跨任务技能复用,不是同任务多采样;二是模型从1.7B增到4B,SkillRise提升7.8,比GRPO的4.7、LaMer的3.3都大。工程上,它比RetroAgent快6.0倍、比SkillRL快4.3倍。

为什么重要

对做agent训练的人,这条路把「学技能」从一条独立的多阶段pipeline,压成了单policy里的一个角色,工程上轻、又能跨任务复用。跨任务test-time scaling尤其值得关注:任务越多、彼此越相关,收益越大,这给agent在长链条工作流里的表现提供了一个新的增长维度。

局限与存疑

作者承认三个边界。它要靠环境给的task-family元数据才能把任务排成序列,真实业务里这种干净的家族标注不一定有;实验只到4B参数;只测了三个text-based基准,且奖励是可验证的outcome reward,连续动作空间或模糊反馈的场景没覆盖。读下来还有一点:三个基准都比较结构化、有明确的成功判定,「技能文档」这种显式记忆在这些环境里天然好使,换到开放域对话或长程真实任务上,文档该写什么、写多长,这套机制能不能迁移,论文没给证据。

术语

原文与代码

相关论文

全部论文解读