Ecdysis: Efficient and Effective Training of Runtime Harnesses for LLM Agents
Ruiqing Yue, Yu Cui, Zhuoyu Sun, Sicheng Pan, Xianhong Xue, Tingyu Li, Ting Li, Wenzhuo Zhu, Yi Chen, Yifei Liu, Baohan Huang, Zhe Cui, Haibin Zhang, Cong Zuo
cs.SE, cs.AI
2026-09-10
Ecdysis 把多条任务失败聚成跨实例模式,再经多角色诊断改 runtime harness。相对逐条自演化,训练最多快 1.84 倍,三套基准平均准确率相对提升 18.56%。
runtime harness 是模型参数冻结之后、推理时包在外面的那一层:规划、工具调用、上下文管理。论文用 Life-Harness 做对照:六个 Qwen3 模型-任务组合上,拆掉全部 harness 层平均准确率 29.72%,人工配好的固定 harness 到 50.28%。用 coding agent 每失败一次就改一版,只到 43.33%,比人手配的还差。
问题不在「会不会改代码」,在这次失败该不该改。一次失败可能是当前模型不会做,也可能是 harness 交互机制有系统性缺陷。前者该迁就模型,后者才该修 harness。现有自演化把每条失败独立送给 coding agent,改得多、验得多,还容易把某次模型癖好写进通用约束。论文把这种倾向叫 model-specific accommodation。
Ecdysis 取名自昆虫蜕皮。训练全程冻结任务模型,只改 harness 源码,从同一份人工 harness 出发。
每轮三步。先用当前 harness 跑训练集,轨迹分数低于阈值 λ 记为失败,抽出任务 ID、终止原因、工具调用史,按失败模式分组。覆盖至少两个不同任务的组优先,单任务组只当辅助证据。一组失败不等于必须修,它只提供诊断。
然后走 Failure-Driven Collaborative Refinement(FDCR)。Analyst 提最小改动,Critic 查过宽触发、误拦合法行为、破坏 runtime 契约、回退已成功任务,Engineer 记下共识和分歧,共用一份 transcript 迭代 K 轮。Moderator 产出结构化修改规格,真正改代码的是 OpenCode,底层模型 DeepSeek-V4-Pro。候选 harness 必须在训练集总分上严格超过上一版才留下,不要求每道题都涨。
相对逐条改,一轮失败无论多少条,coding agent 只调一次。论文把这当成训练时间下降的主因。另有一条选数策略:优先暴露新执行路径或未覆盖缺陷的任务。用四分之一训练失败(5 条)能接近全量。
演化只用 Qwen3-8B,最多三轮候选。冻结后再测 Qwen3-14B/32B、MiniMax-M2.7(230B)、Llama-3.1-8B。τ²-Airline 和 τ²-Retail 各 20 训练加 20 测试,每题三次独立 trial。
五个模型 × 两个 τ² 子集:
| 方法 | 平均准确率 | Pass@3 | Pass^3 |
| Direct | 38.17% | 53.50 | 22.50 |
| Human-Aug. | 51.67% | 66.00 | 37.00 |
| Self-Evolution | 46.67% | 63.50 | 29.00 |
| Ecdysis(无 FDCR) | 54.67% | 66.50 | 42.00 |
| Ecdysis(有 FDCR) | 59.33% | 71.50 | 45.00 |
Self-Evolution 平均还低于冻结的人工 harness。只做 round-level 聚合已经把准确率从 46.67% 拉到 54.67%;FDCR 再加到 59.33%。相对 Self-Evolution 提升 27.1%,相对人工 harness 14.8%。Pass^3 相对 Self-Evolution 涨 55.2%。
把 AgentBench 也算进去,三套基准平均准确率从 58.67% 到 69.56%,相对 18.56%。Qwen3-8B 在 τ²-Airline 上从 35.00% 到 60.00%;同子集上没参与演化的 Qwen3-32B 从 51.67% 到 68.33%。
训练墙钟:τ²-Airline 上 Self-Evolution 8120.6 秒,Ecdysis 加 FDCR 4403.0 秒,1.84 倍;去掉 FDCR 只要 2510.8 秒,3.23 倍。API 账单主要花在演化不在评测:Retail 上 Self-Evolution 8.484 美元,无 FDCR 2.485 美元,有 FDCR 5.763 美元。推理 token 从 11.57M 降到 10.16M,约 12.19%。人工标注的模型迁就比例 t 从 60.0% 降到 45.5%。四分之一数据的 Ecdysis 在 Qwen3-32B 的 τ²-Retail 上 71.67%,全量 75.00%,随机五条只有 65.00%。
给做 agent 运行时的人一个可操作结论:失败日志不能直接当 patch 需求。Self-Evolution 在 τ² 上把人工 harness 从 51.67% 修到 46.67%,「见一次修一次」会把合法动作空间收窄。Ecdysis 把修改粒度从实例提到 round,用跨任务复现当系统性缺陷的归纳偏置。
能直接用的部分是流程,不是某个开箱即用的 harness 成品。底座是 Life-Harness,改码模型是 DeepSeek-V4-Pro。聚合本身贡献了大部分速度和一部分精度,FDCR 用额外演化成本换质量。代码仓库已公开。
论文没有独立的 Limitations 节。训练集每子集只有 20 题,演化只在 Qwen3-8B 上做,温度固定 0.0,最多三轮。t 来自人工细读修改决策,不是自动度量。作者自己写明,跨任务复现是归纳偏置,不是因果归因。
数字上也有不齐的地方。MiniMax-M2.7 在 τ²-Retail 上,无 FDCR 到 100.00%,加上 FDCR 回落到 96.67%。Llama-3.1-8B 在 Retail 上全程趴着,最好也只有 11.67%。AgentBench 接近饱和,Qwen3-8B 上 Self-Evolution 已经 90.00%。标题里的 18.56% 对照的是已经弱于人工 harness 的 Self-Evolution;更硬的对照是 Human-Aug.,τ² 上相对 14.8%。推理时延也不是处处更快,Llama 在 Airline 上从 43.38 秒拉到 159.60 秒。