JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan
cs.CL, cs.LG
2026-08-26
JIT-Agent按任务即时合成记忆、规划、动作和工具编排套件。配上后Flash检索问答以85.1超过GPT-5.6的76.0,GLM-5.2最高再涨20.2分,费用平均降三成六。
Agent强不强,不只看底座模型。记忆怎么压缩、规划怎么拆、动作怎么走、工具和技能怎么露出来,这层套件(harness)经常比模型本身更决定成绩。现有做法多半是Ahead-of-Time:先在一堆轨迹上把套件打磨成一件耐用品,指望它泛化到下一道题。检索要并行取证,终端要瘦ReAct,深度研究要证据工作记忆,仓库改代码要文件系统当状态,套件其实是实例相关的。预先编译一个万能脚手架,搜索空间大、轨迹贵,还对不上下一题的结构。
JIT-Agent把套件收成四个可组合模块:Memory、Planning、Action、Capability orchestration,接口由固定协议锁死,生成的是可执行模块而不是任意Agent程序。HarnessFactory按同一协议重写了13套现成脚手架当种子库。
训练分三阶段。Stage I用更强教师在协议内合成任务适配套件,先模仿再做偏好:奖励提高且时延、费用不恶化才算赢。Stage II把编译失败、接口对不上、运行时异常收成最多两轮的修复轨迹。Stage III用Evo-GDPO:一组候选跟档案里的现任擂主比,奖励、时延、费用分开标准化再合并,只有越过前沿的设计才进档案。部署时生成器冻结,可对单题并行出多个套件,也可在任务流上检索并更新档案。
生成器本身是Qwen3.6-27B训出来的JIT-Agent-27B,执行器可以换任意现成Agent模型。
换套件、不换模型,九项基准上18组对照全部上涨。GLM-5.2均分74.1到81.8(+7.7),DeepSeek-V4-Flash从66.7到75.5(+8.8)。Flash在DeepSearchQA从76.2到85.1,超过GPT-5.6的76.0;OdysseyBench 73.0对GPT-5.6的68.7。GLM-5.2在DeepPlanning-Travel从62.8到83.0(+20.2),Flash在购物规划从59.1到83.9。
| 骨干 | DeepSearchQA | xBench-DS | AgentIF |
| GLM-5.2 原版 | 89.2 | 76.0 | 63.0 |
| JIT-Agent + GLM-5.2 | 93.9 | 88.0 | 69.9 |
| DeepSeek-V4-Flash 原版 | 76.2 | 70.1 | 58.4 |
| JIT-Agent + Flash | 85.1 | 82.0 | 63.8 |
| GPT-5.6 | 76.0 | 81.0 | 68.0 |
固定骨干对比Claude Code、Codex、OpenCode、Hermes、NanoBot时,Flash在DeepSearchQA以85.1超过最强固定套件NanoBot的80.4,token从924K降到400K,单案费用从0.131美元降到0.066美元。六组受控设置里JIT都最省token和钱,相对最便宜的固定套件费用降14.9%到54.1%,平均36.0%。24组跨家族对照相对ReAct平均+7.6。流式档案更新在购物规划、旅行规划、OfficeBench上的累计正确率都高于每次独立生成。
这是把套件工程从手搓耐用品,改成可训练、可迁移、可在测试时复利的能力。对已经很强的开源骨干,换套件就能在多项任务上压过更大的闭源模型,而且轨迹更短、更便宜。生产上不一定要每道题重写整层运行时,但记忆、规划和工具暴露这些部件按任务生成,已经能挪动成本-效果前沿。
正文没有给出拿掉某一训练阶段后的消融表,三阶段各自贡献多少只能从设定推断。流式进化画出了累计正确率优势,没有把终点分差写成表。生成的套件仍要过协议校验和有界修复,复杂运行时的稳定性取决于执行器是否真听得懂协议。论文自己也说,落地时更可能是稳定内核加可替换部件,而不是每次把脚手架推倒重来。