Harness Continual Learning: Continual Adaptation Beyond Model Parameters
Borui Kang, Jinrui Gu, Junhan Lv, Wenbin Li, Lei Wang, Yang Gao
cs.LG, cs.AI
2026-08-19
底座冻结、只改提示记忆和路由时遗忘仍会发生。HCL用提交门卡住历史回退,ALFWorld终均61.74%,比静态harness的47.12%高出约15点。
持续学习过去盯的是参数:新任务一训,旧任务就崩,叫 catastrophic forgetting。现在 agent 常常不训底座,改的是提示、记忆、工具说明、路由规则这一圈外壳。论文把它叫 harness:执行时模型怎么看输入、检索什么、调用什么、按什么流程走,都由它决定。
外壳一改,旧行为照样会坏。记忆更新会换掉旧查询检索到的证据,技能修订会改工具用法,路由一动,以前跑通的工作流会断。底座权重一行没动,正确答案、合法工具调用、能过环境目标的轨迹都可以变成失败。这是 harness-level forgetting,稳定性与可塑性的权衡从参数挪到了运行时状态。
已有 harness 工程多半在优化当前任务的提示或工作流,不管提交之后旧任务还成不成。HCL 把整份可变外壳当成持续学习的状态,把「别把以前会的弄丢」写成提交条件。
部署中的 harness 四件套一起版本化。
更新走 guarded harness evolution,提案和落盘拆开。Continual Optimizer 看执行反馈,按固定顺序改组件,每个组件最多 K 个候选,只替换当前组件、其余冻结,过门的最高分留下。Continual Evaluator 三关全过才提交:
锚点只用于评测,生成候选时看不见。不过门就继续用现网。
实验跨三类。ALFWorld 用冻结 Qwen3.5-9B,六类家务任务顺序学。Minecraft 用 Qwen3.6-27B,50 题课程。文本推理用 DeepSeek-V4-Flash,顺序是 MuSiQue、ProofWriter、GSM8K、HotpotQA。多模态用 Qwen3.6-27B,检测、描述、指称定位、VQAv2。对照含静态 harness、RAG、MemP、MemRL,多模态另加 DGG。
ALFWorld 终评 134 个官方回合。静态 harness 终均 47.12%。RAG 提到 55.56%,遗忘 1.74 在自适应方法里最低,但检索改不了流程。Stability-HCL 61.74%、遗忘 2.64;Plasticity-HCL 62.98%、遗忘 10.94,Two-object 从静态 58.80% 拉到 100%。
| 方法 | 终均 ↑ | 平均遗忘 ↓ |
| Static Harness | 47.12 | – |
| RAG | 55.56 | 1.74 |
| MemP / MemRL | 53.15 / 51.51 | 5.18 / 5.64 |
| Stability-HCL | 61.74 | 2.64 |
| Plasticity-HCL | 62.98 | 10.94 |
Minecraft 上静态 harness 在第 15 题进入平台期,HCL 50 题全过,环境动作 83 次,MemRL 88、MemP 91。文本流上,零样本终均 45.50;Stability-HCL 52.20、遗忘 0.00;Plasticity-HCL 64.70、遗忘 0.07,GSM8K 从 49.40 拉到 92.00。多模态上 Stability-HCL 终均 68.92、遗忘 0.22,零样本 39.40,DGG 42.73。检测从 4.27 到 65.34,指称从 43.00 到 91.60。VQAv2 零样本仍最高,84.87 对 Stability 的 79.33,底座本来就会答图问。
把 B 扫成 0、1、3、无穷,遗忘从 0.39 升到 3.45,终均最高出现在 B=1 的 63.46,无约束只有 60.13。更放开不等于最终更强。消融里拿掉记忆更新,遗忘升到 0.83,终均掉到 62.28,完整版 63.41。
多数团队已经在冻底座、改提示和记忆。这篇把这件事写成持续学习问题,并给出一个能拧的旋钮:历史损失预算。做内部 agent 的人可以直接抄提交门,不必先上参数级持续学习。
它是框架加评测协议,不是即插即用的产品。Optimizer 和 Evaluator 都要反复跑冻结模型,锚点回放有成本。论文自己点名未解决的是高效保持评估、harness 内容压缩,以及更长交互流。
B=0 仍有 0.39 的测试遗忘,因为门只护有限锚点,测的是另一套历史测试题。MemP、MemRL 是在他们的 harness 里重实现,不是官方仓库原样复现。多模态消融用的是更小的 Qwen3.5-4B,和主实验 27B 不是同一底座。Minecraft 只报了课程完成和动作次数,没有按任务类别拆遗忘。文本流上 MuSiQue 在 HCL 下低于零样本 35.00,Stability 掉到 27.60,多跳检索这类任务,harness 更新可能帮倒忙,论文没有单独解释。任务顺序固定,没有打乱顺序的稳健性实验。