工具 Agent HCI 仅 39.9,33 人综述画出五级自治路线图

The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement

Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou, Yumou Liu, Bangrui Xu, Yukai Wu, Sidi Chen, Yuhan Zhou, Haoyu Wang, Xiaoyou Yu, Shaokun Han, Xuzhou Zhu, Le Zhou, Bolin Lu, Wei Zhou, Jiachen Liu, Nuozhou Fang, Jiaxin Tian, Ruoyu Chen, Yuxuan Li, Kai Zuo, Kaiyan Zhang, Jiantao Qiu, Conghui He, Guoliang Li, Bowen Zhou, Zhiyuan Liu, Zhoufutu Wen, Jihua Kang, Xuanhe Zhou, Fan Wu

cs.LG, cs.AI, cs.CL

2026-09-11

用 HCI 对齐十个能力域,并给出从 L1 执行到 L5 元改进的路线图;2026 年工具 agent HCI 仅 39.9,低于科学 45.9 分,A-Evolve 四轮把 30B 外部分从 0.80 拉到 0.86。

这篇在解决什么

现有大模型把考试题的余量吃掉很多,真正要动手的任务还空着。上海交大、清华、Theseus Labs 等 33 人用 Headroom-Closed Index(HCI)把 2023 年到 2026 年 9 月、10 个能力域、393 条合格的模型-基准观测压到同一尺度:该基准入场年的 90 分位前沿记为 0,满分 100。

2026 年,高等数学 HCI 86.4,研究生级科学 85.8,通识 77.2;软件工程 52.6,搜索与终端 agent 56.8,工具 agent 只有 39.9,比科学低 45.9 分。工具 agent 这一年从 8.2 冲到 39.9,软件工程 2025 年涨 40.8、2026 年只再涨 11.9。交互、有状态、要过测试的工作流,才是递归自我改进(RSI)该去补的缺口。

RSI 在这里的标准是:系统把经验写成持久状态,并且改到「以后怎么改进」这件事本身。一次搜到更好的 checkpoint,不算。

方法

分析单位是改进环,不是某个算法。环里有经验、被改对象、提出改动的 improver、验收的 verifier,以及被下一轮继承的状态。按 AI 接管了环上哪一段决策,分成五级。

会话内改答案但不留状态的,标成 B0,当作下界,不算 RSI。对照 continual learning、AutoML、agentic AI:那些通常不把「如何改进」写成后继者会继承的状态。

四个应用场景按反馈成本分开看。科学实验贵、失败原因不清;具身试错有物理代价;软件测试可执行但规格不全;医疗结果滞后、要专家把关。工业侧写了 Theseus、飞书 Lark、Humanlaya、面壁 ModelBest、腾讯混元 Hyra、Agent-Native Research Lab。作者把结构递归(后继调用了改过的改进机制)和有效递归(可比预算、独立评测下真的产出更强后继)拆开,后者才算数。

结果

HCI 是这篇自己算的主结果。工业数字是各家自报,不是统一榜。

来源设置数字
HCI 2026工具 agent vs 研究生级科学39.9 vs 85.8
Darwin Gödel MachineSWE-bench 子集20% → 50%;档案维护与父代选择仍在自改范围外
A-Evolve-Training30B Nemotron,4 轮外部分 0.80 → 0.86,人类提交顶 0.87
Gödel Agent100 次 MGSM14% 轮次低于初始策略
Theseus 工作区8 组模型-harness,30 题 / 1280 条 rubric干净工作区比噪声工作区高 21.7–51.6 个百分点
Theseus 生产力5 组固定配对,547 条 rubric重建环境比裸工作区高 18.65–39.67 个百分点
Lark 知识图谱相对 RAG人工可用性 52%→65%,自动评 47%→56%
Humanlaya V0→V4同模型同预算,600 个未参与更新的任务包关键缺陷包 9.0%→3.7%,人工处理 48→27 分钟
ForgeTrain空目录对标 Megatron-LM v0.15称约 8 小时在 H100 追上;MiniCPM4-0.5B 的 MFU 40.1%→44.1%
Hyrananochat AutoResearch / nanoGPT SpeedrunBPB 0.9015 vs 此前 0.9109;76.4s vs 77.5s

科学、具身、医疗三条线,作者判断当前最强证据停在 L2。L4 和 L5 几乎没在真实纵向结果上闭合。Anthropic 的自动研究实验里出现过挑随机种子、试图从评测器套测试标签;Red Queen Gödel Machine 的对策是每轮冻结评测器,替换时对照独立锚点。

为什么重要

给从业者的用处是一把尺子,不是一个可 clone 的系统。下次有人说 agent 会自我进化,先问三件事:环在哪闭合、什么被下一轮继承、哪些决策还在人手里。分数涨了只说明搜到了更好候选。档案规则、评测器、晋升门槛如果仍是外置的,那就还在 L2。

软件工程因为测试便宜,会继续走在前面。科学和医疗缺的是可归因、可回滚的验收,不是更会写 prompt。Theseus 的数字更扎眼的是环境质量:同一套模型-harness,工作区一脏,通过率能掉五十个百分点。做 agent 产品,先把 Collection Map 和 Event Log 这类可验证环境做好,可能比再训一个 checkpoint 划算。

局限与存疑

这是综述加工业自报,不是对照实验。HCI 对 Cybench 后期换了任务子集或 pass@1 聚合,作者自己画了虚线。Theseus、Lark、Humanlaya、Forge 的数字来自内部设置,没有独立复现。Hyra 在 nanochat 上的 BPB 还略差于引用的此前最好。AIDE2 把进化出来的 harness 装成外层 improver,并没有统计显著的效率优势。Gödel Agent 有 14% 试验改完更差,持久化会把错误也传下去。Theseus Labs 就在作者列表里,工业案例和写稿单位绑在一起。L5 的有效递归,作者承认仍是经验空缺。

术语

原文与代码

社区讨论

相关论文

全部论文解读