长程智能体可用任务时长每 4 到 6 个月翻倍,人大综述用 harness 与模型协同演化梳理全局

2026-08-06

人大等团队的综述把长程智能体定义为 harness 与模型协同演化的系统,并据 METR 数据指出前沿可用时长每 4 到 6 个月翻倍。

这篇在解决什么

「长程智能体」(long-horizon agent)几乎成了 AI 圈的口头禅,但含义越来越糊。长上下文、长运行、自治(autonomous)、自演化(self-evolving)这几个词被人混着用,每个其实强调不同侧面。已有的综述通常只盯一个零件,比如记忆、上下文工程、harness、自演化或 agent 强化学习,单独看都成立,合起来却没人说清到底什么是长程智能体、怎么造一个靠谱的。

这件事重要,是因为长程能力正变成「能不能把活真正交给 agent」的那条实际分界线。论文援引 METR 的测量:前沿智能体能独立完成的任务时长,这几年从秒级一路涨到小时级;前沿编码 agent 已经能在一个项目上连跑数小时,GLM-5.1 据称能在一项任务上独立执行最长 8 小时。

长程任务为什么难?论文归纳出三种反复出现的失败模式。目标漂移与误差累积:几千步里慢慢偏离原目标,单步的小错沿轨迹越滚越大。上下文腐烂与上下文上限压力:工作上下文一过某个利用率阈值,agent 就会突然退化,或者干脆提前收工、把半成品当成成品交差。奖励稀疏、延迟且不可逆:很多任务到最后才给一个反馈信号,中间决策几乎学不到东西,而且走得越久越容易踩一个无法挽回的动作。

方法

核心论点一句话:长程智能体是「外部 harness 工程」和「内部模型优化」两条线协同演化的系统级能力,不是基座模型自己的属性。

形式化写成 Agent = πθ ⊕ H。πθ 是基座策略,H 是环绕它的运行时结构(循环与工作流、上下文与记忆、工具与技能、编排逻辑、钩子、校验机制)。⊕ 不是简单相加,而是运行时耦合,H 把「动作、观察、记忆」的回路闭合在 πθ 周围。整个系统被建模成 POMDP(部分可观察马尔可夫决策过程),奖励通常稀疏且延迟,于是中间决策的功劳只能从一个终点信号里反推,这就是长程信用分配(credit assignment)难题。

把「任务要超出一个上下文窗口多远」当成可观测的难度轴,分出三级任务和对应的三级能力:

任务级跨度需要的能力
H1 单上下文分钟级,一个窗口内C1 交互式推理:多步互相依赖的决策串成一条轨迹
H2 跨上下文小时到天,撑爆一个窗口C2 状态与记忆:压缩、外置历史,断点续跑
H3 跨任务流终身级,开放任务流C3 经验积累:沉淀可复用技能,持续变强

三级嵌套:跑 H3 的 agent 在每个子任务里仍得过 C1、C2。论文据此把控制面的演化也分成三段:提示工程(2020 到 2023,CoT、Plan-and-Solve 之类)、上下文工程(2023 到 2025,RAG、GraphRAG 之类)、运行时 harness(2025 至今,ReAct、AutoGPT、OpenHands、Claude Code 之类)。全文再按六个视角铺开:基础、演化、harness、优化、应用、前沿。

结果

作为综述,它的「结果」是一套归因框架加一份实证趋势分析,最有分量的数字来自 METR 的「50% 完成率任务时长」,也就是某 agent 能以 50% 可靠度完成的那类任务的人类专家耗时。

区间倍增周期备注
全周期(2019 起,拼接序列)约 196.5 天(6.5 个月)早期模型用 TH1.0、后期用 TH1.1
2023 年至今(TH1.1)约 130.8 天(4.3 个月)提示可能加速,但方法不同不能下定论

到 2026 年 5 月,前沿时长从早期模型(GPT-2)的秒级,涨到 Claude Opus 4.6 约 12 小时、Claude Mythos Preview 至少 16 小时,跨度近四个数量级。16 小时是 METR 认为当前任务集已不可靠的边界,超过这条线的估计都要打折。

应用与评测方面,论文把长程 agent 按与环境接口分成五类:软件工程、信息检索、计算机操作(浏览器、桌面、手机)、多模态、通用 agent,并给出一张约 80 多项基准与系统的对照表,刻意偏重多小时级自治,比如 MLE-bench、PaperBench、Terminal-Bench、OctoBench 和 METR 自身。作者的明确立场:一份跑分是「模型加 harness 加训练配方」的联合产物,不能只算在模型头上。

为什么重要

对从业者,这份综述最大的实用价值是给了一套归因词汇。当你看到某个 agent 跑分暴涨,这套框架逼你问:增量来自更强的策略、更好的运行时 harness,还是数据或评测的变动?harness 与权重双向迁移的视角还有一个直接推论:相当一部分长程能力可以靠改运行时拿到(更聪明的循环、记忆压缩、外部校验、钩子),未必非要重训。H1/H2/H3 阶梯则告诉你,你的任务到底卡在哪一级能力上。两个判断尤其值得记下:环境构建(而非模型规模)是下一阶段能力的限速环节;harness 才是生产级 agent 真正的对齐与权限面,模型侧对齐必要但通常不够。

局限与存疑

协同演化、harness 与优化这个框架是组织视角,不是被实证证明「更优」的分类法;H1/H2/H3 同样是人为操作轴,论文自己也说时间范围是描述性的、不是定义阈值。

METR 的倍增数据是两套方法拼出来的(早期 TH1.0 加后期 TH1.1),所以「2023 年来加速到 4.3 个月」只能算提示,作者明说不能当成加速的确证。16 小时以上本就不可靠,对 Mythos Preview「至少 16 小时」这类数字要留着保留。更根本的是,这条趋势只刻画了「涨」,却解释不了「为什么涨」,无法区分增量来自策略、harness 还是二者协同,而这正是综述想解决却仍解决不了的归因难题。

范围上,它不打算覆盖通用 agent、记忆或强化学习的全貌,只取与长程相关的那部分;基准表是有代表性、非穷尽;引用里混了不少产品文档与开源实现(Claude Code、Cursor、豆包),并非都是同行评议的研究。

术语

原文与代码

社区讨论

全部论文解读