日常长程 agent 跑出 0.821 新纪录,框架比单条 ReAct 更值钱

OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

cs.CL, cs.AI, cs.HC, cs.LG, cs.MA

2026-08-05

OneDayAgent 把开放日常任务拆成有界子任务、压记忆、最后验证修复,用 GLM-5.2 在 104 任务的 AgentIF-OneDay 拿到 0.821,超过最强基线 0.799;同一框架套 5 个后端都涨分。

这篇在解决什么

开放式日常任务(订一趟行程、整理一份带附件的报告)给 agent 出的难题是:长程、跨环境、多模态。模型要在很多步之间保住目标和约束,同时切换异构工具和附件。结果就是三类失败扎堆出现:目标漂移(早先的格式要求到后面忘了)、状态丢失(前一个环境里搜到的证据切到本地文件环境时没接上)、上下文超载(还没出成果,context 先爆了)。

此前的工作各打一类失败:推理脚手架、反馈式修订、记忆管理。问题是这三类失败互相放大,单独修一个不够。而「一套框架能不能同时管住它们、还能跨不同后端通用」这件事,之前没人正面验证过。

方法

OneDayAgent 是套在 LLM 后端外面的执行框架(harness),后端 LLM 负责推理,框架负责管流程。核心是三个机制。

任务分解。框架把原始请求拆成一串有界子任务,每个子任务是一个可执行单元,能调工具、产文件、提交紧凑答案。后端每步只面对一个短目标,框架则把原始请求当作全局意图兜着。子任务边界同时是省 context 的接口:后面的子任务继承任务级状态,但不继承前面那条完整 ReAct 轨迹。

执行记忆。三个子机制压住 context 压力:搜索结果截成结构化片段、长网页摘要成有界摘要、文件读取降成按模态的预览;子任务之间用提交的答案和文件句柄当紧凑检查点,跨环境复用证据而不带整条轨迹;一旦累计轨迹超过后端窗口的阈值,早期轮次被压成技术摘要,系统提示、原始任务、最近几轮原样保留,快撞硬上限时走确定性的应急裁剪。

全局验证与修复。合成产物之后,框架做一遍对照原始请求、各子任务答案、声明的附件的核验,是产物级、任务全局的,不只看最终文本。发现缺陷就进 ReAct 式修复,按核验给出的缺陷描述定点改,不重启所有子任务;改完再核验。作者说得直白:子任务全做完,不等于交付物满足原始请求,长程执行照样可能丢早期约束、漏隐性要求。

结果

评测在 AgentIF-OneDay 上跑,104 个任务、767 个实例级评分点,覆盖工作、学习、生活三类场景。用 GLM-5.2 后端,OneDayAgent 拿到整体 0.821,是新的 SOTA。

方法整体分
AutoClaw(最强基线)0.799
Manus0.645
ChatGPT-Agent0.626
OneDayAgent (GLM-5.2)0.821

同一套框架套到 5 个后端上,分数从 0.613 到 0.821:GLM-5.2 最高,Gemini-3.1-Pro 0.743,Qwen3.5-397B 0.708,Qwen3.5-9B 0.624,Qwen3.6-27B 0.613。排序还不单调,Qwen3.6-27B 没赢过更小的 Qwen3.5-9B,说明胜负更多看后端与框架的契合度而非单纯规模。

消融在 GLM-5.2 上做。执行记忆不能关,关了直接 context 爆掉做不完任务。分解和验证各做一遍:单开分解 0.804,单开验证 0.804,全开 0.821,都比基线 0.771 高。两个模块合起来的增益小于各自增益之和,说明它们修的是部分重叠的失败案例。性价比上验证完胜:验证只比基线多花 2.2 分钟就追平分解的分数,分解要多花 10.6 分钟还多调约 60% 的工具。104 个任务里 95 个一次过验证,9 个进修复,其中 6 个被救回来。

为什么重要

对做 agent 的人,结论是工程化的:长程日常任务,赢点在框架不在模型。同一套分解、记忆、验证修复的壳子能抬升所有测过的后端,压过单条 ReAct。最划算的单品是最后那道验证修复,低成本、追平分解的收益。换后端不是无感的,不同模型在同一工作流下会跑出不同的执行风格(时长、调用量、修复率),选型得实测。

局限与存疑

作者标了几个边界。结论只在 AgentIF-OneDay 上成立,要推广得在更多基准上验证。跨后端不是无感迁移,分数横跨 0.613–0.821,而且全套不总是最优,验证在 17 个任务上反而比全套分高。上下文管理跟任务质量稳定的因果关系没做因果隔离。安全上,当前实现直接跑在宿主机上、没有工作区隔离,会执行任意 shell 命令且无白名单,prompt 注入如果扛过压缩还会渗进后续子任务。判官也换了:官方的 Gemini-3-Pro-Preview 在 2026 年 6 月已不可用,改用更严的 Gemini-3.1-Pro-Preview,作者因此称自己的数字偏保守。

还有一层要读者自己掂量:论文出自浙大 zjunlp,headline 后端 GLM-5.2 出自智谱,而 GLM-5.2 这条线是最高成本配置(单任务 53.6 分钟、51.6 次工具调用、585.7 KB context),跑出 0.821。0.821 对 0.799 的 2.2 个点领先,读的时候要把这点放进上下文。

术语

原文与代码

相关论文

全部论文解读