冻结权重只改记忆,Recuris把Opus 5在零售对话上抬到87.9%

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang

cs.AI, cs.CL

2026-08-26

Recuris冻住基座模型,用工作记忆对齐技能调用并跨任务补丁记忆;37对里35对成功率上升,Opus 5在τ²-Retail上从72.4%到87.9%,最长任务优势+32.2。

这篇在解决什么

长程任务里,对话历史越堆越乱,智能体分不清哪些目标还没做完,该调哪条技能。现有经验记忆多半按初始指令或整段历史检索,指令已经过时,历史里又混着做完的步骤和噪声。缺的不是经验,是一个紧凑、可验证的任务状态,用来对准「现在需要什么」。终点成败也定位不了该修技能、状态机、调用策略,还是完成检查器。

NUS、普林斯顿、斯坦福和牛津的 Recuris 把递归自我改进从改权重、改整套 agent,收成改一层外部的 Skill Memory。

方法

基座 LLM 冻住。可变的是四件套:经验记忆(可复用技能)、工作记忆规格(状态字段和更新提案)、调用策略(何时、用什么键去取技能)、检查器(环境回执是否撑得住状态变更)。任务内,工作记忆记下每个目标的 pending / done / blocked。到了约定事件,比如即将发出改状态的工具调用,调用策略按当前状态取出对应技能;检查器只在工具回执支持时才把目标标成完成,口头说「好了」不算。

任务间,固定的 Meta-Agent(实现是 Claude Code,论文里全程不改)读结构化轨迹:每一步的状态、取出的技能、动作、观察、提案、检查器判决。它把失败归到上述四个组件之一,只补被点名的组件。候选补丁要过验证门:修得了源任务,且不能把已会做的锚点任务做坏,否则记忆保持原样。外层程序、工具、模型都不改。没有跨任务结构的基准,同一套机器改成单任务重试:失败后只改经验记忆再试,对照是同等次数、记忆冻住的重试。

进化只在部署模型 doubao-seed-2-0-pro 上跑一遍,得到的记忆原样装到其他模型上评测。权重全程不更新。

结果

四个长程基准、十个模型,37 个已完成的模型–基准对里 35 个任务成功率上升。

模型基准基座Recuris
GPT-5.6 Solτ²-Retail58.376.1(+17.8)
Claude Opus 5τ²-Retail72.487.9(+15.6)
Doubao-2.0-Proτ²-Retail58.181.4(+23.3)
Qwen3.6-27BSkillFlow42.258.7(+16.6)
Qwen3.6-35BSkillFlow35.348.8(+13.5)

两个没涨的对:Granite-4.1-3B 在 SkillFlow 上 0.3 落到 0.0,Gemini 3.7 Flash 在 τ²-Airline 上 86.5 落到 85.0。优势随任务变长加大,按任务固有完成长度分的四个分位都领先,幅度 +17.0 到 +44.7,最长一档摘要里写 +32.2。读操作召回各变体都在 88%–98%,分开的是写路径:基座有 42% 该写的回合一个写都没发出,Recuris 是 16%。

Retail 上工作记忆单独加 +23.9,经验记忆单独加 +2.0 且区间含 0。同一套技能库每回合全塞给模型、让模型自己挑,成功率 65.6;按调用事件只塞对上的那一条,到 83.6。Airline 拿掉写前审查掉 13.5 分,Retail 拿掉状态板掉 17.3 分,关键组件因域而异。把已知故障注入组件后,只看结局能定位到责任组件的宏平均准确率 13.0%,原始轨迹 37.0%,结构化轨迹 64.8%。Terminal-Bench 2.1 没有跨任务结构,13 轮进化没放进任何补丁;单任务四次尝试的抬头几乎全是重试预算(+26.4),适配本身只再加 +2.3(p=0.774)。

为什么重要

这是一种可部署的、有边界的递归自我改进:不碰权重,只改记忆控制层,补丁可归因、可回滚,还能从中等模型搬到没见过的前沿模型。Opus 5 在 Retail 上被同一份记忆抬到 87.9%,说明前沿模型在长程执行上没有饱和,缺的是「还有哪些目标没做完」的状态机,不是更多参数。

前提很硬。跨任务进化要共享工具和流程,Terminal-Bench 那种一题一环境就搬不动。技能库的价值取决于调用时机,整库常驻上下文比不给技能更差,还更贵。

局限与存疑

论文把递归明确收在记忆层,这不是权重级 RSI。Airline 样本只有 50 题,多数区间含 0,只能当方向。记忆在一个中等模型的失败上长成,换模型再进化会变成另一份记忆,单源设定测的是可迁移的共性,也留下「过拟合部署模型癖好」的可能。检查器在 Retail 上拆掉几乎不影响通过率,定位实验没法测这一类。验证门比它能分辨的更细,有的被拒补丁事后在 held-out 上是涨的。失败模式图里幻觉完成最多降约 86%,摘要写成「最多 80%」,口径略松。

术语

原文与代码

相关论文

全部论文解读