不改模型权重,Argus 靠验证门控让 agent 敢于中途换路线

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng

cs.AI

2026-08-06

Argus 是一个 agent 运行时框架:不动模型权重,靠四角色分离与验证门控让 agent 在长程任务里把失败与转向都积累成可复用进度,SWE-Bench Pro 拿到约 78%(Direct Copilot 59%)。

这篇在解决什么

让 agent 跑一个长任务(改一个真实仓库、训练一个模型、做一组数学证明)时,真正的麻烦是中途要不要改目标。一开始定的题目常常是错的:软件需求要等实现出来才知道缺什么,数学猜想很少以原始形式得证,系统验证里 specification 和实现可能都有错。一个能干的 agent runtime 必须能在证据支持时坚持当前路线,在证据暴露问题时转向。

难点在于:一个放弃了既定目标的系统,可能是因为发现目标定错了,也可能只是没做出来在找借口。从最终产物上这两种情况看不出区别。如果放任转向,目标会慢慢退化成 agent 凑巧能做完的那件事。现有的 agent 框架(ReAct、SWE-agent、OpenHands、The AI Scientist、Arbor)默认目标是给死的,只优化执行。Argus 要解决的就是怎么让转向可记录、有证据、受授权,从而和放弃区分开。

方法

Argus 的核心是四角色加三平面。Control Plane 锚定整个 campaign、调度任务;Execution Plane 跑有边界的 mission、调真实工具改产物;Record Plane 存不可变的事件记录,但不下完成判定。四个角色是:

主循环是 Manager→Planner→Engineer⇄Reviewer→Manager。关键设计是「做工作的人」和「判定完成的人」分开,消除了自我验收的偏差。

Argus 用一个工作合约 Kt =(用户意图 ι,操作目标 ot,约束 ct,验证标准 vt)区分两类东西:用户意图 ι 在整个 campaign 里不动,操作目标、约束、验证标准可以随证据精化。任何实质性的精化都要走 ManagerAdmit 操作,拿到 Manager 或操作者授权并记录。这把「改目标」从一句模糊的话变成了一个有证据、有权限、有记录的动作。

「固定权重的运行时自我进化」是最容易被误读的地方。模型参数 θ 始终不变,进化的是运行时状态 Ht = {记忆,技能,工具/流程,验证器,路由}。验证门控(verification gate)规定:candidate 的记忆、技能、流程、验证器、路由决策、甚至被否决的路线,只有在通过任务原生的证据检查并由授权角色 commit 之后,才变成后续 mission 可复用的状态。所以一条跑失败的分支不会白跑,它会作为「被否决的路线」留进状态里,下次能被引用。跨 session 的连续性靠一份 CHECKPOINT.md 存持久状态、证据引用和悬而未决的问题。

结果

七个 GPT-5.5 benchmark arena,指标各用各的原生单位:

arenaArgus对照
SWE-Bench Pro78%Direct Copilot 59%(用 1.41× aggregate tokens)
AARRI-Bench76.8%(63/82)论文最优 68.3%
数学数据合成(Arbor suite)28.0 gapArbor 20.83 / Claude 8.33 / Codex 6.25
nanoGPT speedrun79.77 s人类 80.18 s
nanochat B200 / H1000.9636 / 0.9855 BPB人类最优 0.9646 / 0.9879
SOL-ExecBench(GPU kernel)全球第 62 次单项第一、7 次前三

BPB 越低越好,nanoGPT 越快越好,所以 nanochat 和 nanoGPT 上 Argus 都略优于人类最优。SWE-Bench Pro 的纵向分析最能体现「自我进化」:731 个任务里 466 个(63.7%)调用独立 Reviewer,其余 265 个 Engineer 自审;Reviewer 在 43 个任务上要求返工,改完后 34 个过官方验证器、22 个走完严格的 continue→revision→done 闭环,另有 35 个被判 blocked。成熟的 wave(W19–22)比启动期(W1–6)每个任务少用 21% 的 solve-input token、15% 的活动时间。这条曲线不单调,同期还记下 34 次验证器挽回、22 次严格评审闭环救回。

为什么重要

这篇的真正卖点不是某个 benchmark 分数,而是一个固定权重的 agent harness 能积累被验证过的做法,并产出外部可核实的产物。RWKV6 的一个 TileLang kernel 经 Moonshot 系 FLA(Flash Linear Attention)协作者审查后合并进了上游 fla-org:main(PR #1045,commit c70f11c)。ACE-2 是 runtime 自己写 RTL、搭验证环境、跑综合与时序的芯片(Qwen2.5-0.5B W4A8 推理加速器):功能上 Layer 0 的 18 个算子全对、两 token 运行在 12.4 亿仿真周期里跑通 13914/13914 条命令;物理上 62283 个 cell、0.614 mm² 非 SRAM 面积(上限 2.0 mm²)。六个论文管线跑了 640 小时、254 个 mission、16 次阶段回滚,全部走到最终投稿(2 篇 AAAI 格式、4 篇 ACL 格式)。一个数学 campaign 保留了一条被证伪的路线和六条有证明支撑的前沿推进。

对从业者来说,Argus 提供了一个可信的范式:不必等模型本身变强,把「分离提案与验收、记录被否决的路线、让进度跨 session 累积」这几件事做扎实,长程 agent 的失败和转向就能变成可复用资产,而不是每次重头来过。它产出的带决策标注的轨迹,也是未来 SFT 和 RL 的现成训练数据。

局限与存疑

作者自己把局限列得很清楚,值得照搬。最关键的一条:SWE-Bench Pro 是单一任务序上的整系统对比,不是因果消融。startup→mature 的「少用 21% token」是观测性的,不是控制实验;Reviewer 路由是自适应的、任务顺序固定、Direct Copilot 的逐 wave token/时间记录拿不到。所以四个角色、持久状态、评审各贡献多少,这篇没拆开。

另一条容易被误读:「固定权重自我进化」不等于模型变聪明,进化的是运行时状态(记忆、技能、路由),换个 campaign 或换套工具这些状态未必带得走。论文也承认 generality 没测透,换 GLM-5.2 跑 Claude Code 的实验还没完成、没有对照 baseline。验证器本身可能编码了错的性质,runtime 能记录和修订验证器但不能让验证器变对。ACE-2 是「在演示范围内认证」,不是流片,没有布线时序、功耗 signoff、DRC/LVS、GDS、硅验证。六个论文管线来自同一个共享研究环境,case study 只证明端到端能跑通和能在评审下恢复,不证明录用、新颖性或比人类团队强。

术语

原文与代码

社区讨论

相关论文

全部论文解读