4小时改训练算法均分0.166,过半提交从不碰学习规则

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

cs.AI, cs.CL, cs.LG

2026-08-21

冻结10类训练算法仓库,Agent有4小时改代码、至多12小时重跑。290格均分0.166(原算法=0.1,最优=1.0)。碰到学习规则的提交均分0.226,只改运行侧的0.126。

这篇在解决什么

递归自我改进(RSI)问的是:一套 AI 能不能改进「生产下一套 AI」的过程,让改进被继承。论文把过程拆成三层。系统工程改 kernel、并行和通信,顶到硬件 roofline 就停。数据层改配比、合成和过滤,顶到人类文本存量和合成语料的衰减。算法设计改目标函数、更新规则、正则和日程。Adam、LayerNorm、DPO、GRPO 都是付一次、后面每次训练按新汇率兑换算力。若 RSI 要复利,复利主要得来自这一层。

现有 agent 基准测不到这一层。Kaggle 风格的 MLE-Bench 赢在特征工程和集成,学习算法常常是库调用。PostTrainBench 和 RSIBench-Data 的主杠杆在数据和初始化。MLS-Bench 把组件边界交到 agent 手里,分数把执行层改进和学习规则改动混在一起。Karpathy 的 autoresearch 打开训练文件,但五分钟单脚本更像超参搜索,对照 CMA-ES、TPE 还输。缺的是一个能分开的问题:agent 改的是这次怎么跑,还是模型怎么学?

方法

AI4AI-Bench 冻结 10 个真实研究仓库,覆盖 10 类训练算法:监督微调、多轮 agentic RL、on-policy distillation、Bradley–Terry 奖励模型、DPO、diffusion RL、机器遗忘、离散图扩散、权重平均、一次性剪枝。后两个不做训练,但选哪些 checkpoint、按什么准则丢掉哪些权重,同样是算法问题。

合同对每道题相同。agent 在 1 张 B300 上有 4 小时读仓库、改训练代码、用便宜 proxy 试想法。时间到只交源码补丁,训练权重和缓存一律不带。补丁在干净容器里从初始化重跑,最多 12 小时;训练类任务取最近 3 个 checkpoint 里方向上最好的一个,由事先冻住、看不到工作区的 evaluator 打分。对照是同一套流程跑仓库原算法。硬件、预算、评测资产两边对齐,唯一差别是源码。

10 个指标单位不同,不能直接平均。每道题映到同一把尺 σ:0 是无信息的模型,0.1 是仓库原算法,1.0 是任务最优(准确率 1、RewardBench 100、困惑度 1 这类理论上界)。困惑度走 −log,否则 OWL 从 53.4 降到 16.2 会被读成关掉 71% 的差距,按交叉熵只关掉约 30%。没交出可评分模型记 0。

测的不是裸模型,是「模型 + harness + 推理力度」整套系统。6 套:GPT-5.6 的 Sol、Terra、Luna 走 Codex 六个力度,Claude Opus 5 和 Sonnet 5 走 Claude Code 五个力度,Kimi K3 只跑最高档。29 个配置 × 10 题 = 290 格。

结果

整场研究坐在尺子最低的五分之一。290 格均分 0.166,最强系统 Claude Opus 5 均分 0.250,单配置最高是 Opus 5 medium 的 0.288。0.1 已经是仓库自带算法,最强系统从这里走向最优,关掉的距离不到五分之一。反向看,124/290 格掉到 0.1 以下,超过五分之二的尝试把仓库改差了。

系统均分 σ探索花费中位
Claude Opus 50.250$181
GPT-5.6 Sol0.191$434
Kimi K30.174$30(单档)
Claude Sonnet 50.145$98
GPT-5.6 Terra0.135$129
GPT-5.6 Luna0.117$48

花费解释不了排序。Sol 中位配置探索花 $434,约是 Luna 的 9 倍,分数排第二;Opus 5 领先,花费不到第二名的一半。Sonnet 5 花大约两倍于 Luna 的预算,均分只高 0.028。

分任务更刺眼。OpenR1 的 LiveCodeBench 基线 0.127,最好一格只到 0.138;OPD 的 AIME 基线 0.436,最好 0.449。RAGEN 的 Sokoban 基线 0.170(held-out 87/512),若干 Opus/Sol 格打到 1.00,做法是丢掉 GRPO,改用最优着法做模仿学习。OWL 剪枝基线 WikiText-2 困惑度 53.4,最好降到 13.0,有的提交把「剪一次就停」改成筛选、逐层蒸馏、再 masked KD 微调。DDPO 美学分基线 5.84,Opus 5 max 打到 17.7,离最优 23.23 更近。DiGress 测试 NLL 基线 65.8,最好只到 63.7。

提交改了什么,才是这篇真正要分开的。另一套语言模型读 diff,按八类打标,一类提交平均命中 3.13 类。280 份可分类提交里 17 份改不动任何可归类的东西;剩下 263 份中,141 份只动运行侧(训多久、存多勤、学习率、batch、留哪个 checkpoint、LoRA rank),122 份碰到学习侧(loss、监督信号、更新规则、数据)。学习侧均分 0.226,运行侧 0.126,差 0.100,标准误 0.022。去掉 RAGEN 这列,仍是 0.182 对 0.128。真正改更新规则的只有 23 份,占 8.7%。

推理力度主要买的是胆量。学习侧占比从最低档 8% 升到最高档 64%,均分从 0.094 升到 0.196。Codex 网格里,4 小时内评估次数中位从 4 次到 16 次,改动行数从 18 到 246,输出 token 从 11k 到 109k,单任务探索花费从 $1.69 到 $34.60。整场探索 API 花了 $5334,不含 12 小时 GPU。19 格得 0 分:8 格没交出能用的补丁,11 格补丁跑完写不出可加载的合并模型;12 格出在最低两档。

为什么重要

如果你在看「agent 能不能自己做算法研究」,这篇给的答案很冷:在 4 小时、单卡、真实仓库的合同下,今天的系统更像在找回一个还过得去的默认,而不是设计出越过默认的算法。分数涨的地方,几乎都是愿意改学习规则的那一半;调预算和超参的那一半,均分只比原算法高一点。

对做训练的人,有两个能用的观察。一,agent 会把剪枝改成「剪完再蒸馏」,把 RL 改成模仿,说明任务说明书一旦没把算法家族钉死,agent 会改题。二,proxy 和最终指标的隔离是这套协议的承重墙:4 小时里随便查便宜指标,打分指标事后才算,evaluator 看不到工作区。这比让 agent 对着测试集调到最好,更接近工业训练的开发/评测分离。

这是渐进的评测工作,不是证明 RSI 可行或不可行。它量的是单跳:改完一次训练算法,下一次训练会不会更好。没有把改完的 agent 再拿去改下一轮。

局限与存疑

论文没有单独的局限节,正文里已经把几处软肋写出来了。学习侧与运行侧的分差不是随机对照:更强的系统更常走到学习层,所以 0.10 的差距是「走到那里的提交」和「没走到的提交」之差,不是「走到那里」的因果效应。分类由另一套语言模型读 diff 完成,没有报告人工复核一致率。没有人类专家基线,不知道 0.250 离「一个熟练的训练工程师在同样 4+12 小时」有多远。

协议本身也窄。4 小时探索加 12 小时单卡重跑,覆盖不了需要多机、多日的算法。proxy 在部分任务上和最终评测共用语料,隔离的是「能不能用最终指标打分」,不是样本不相交。RAGEN 上的满分来自模仿最优解,OWL 上的大降来自把非训练任务改成训练任务。这两类赢法测的是会不会重新定义题目,跟把 GRPO 或一次性剪枝本身改得更好不是同一件事。

把 10 个不可比指标压到「0.1=原算法」这把尺,让跨任务平均变得可算,也把所有系统都挤进最低四分之一。系统排序在这个区间里成立,离逼近最优还差一个数量级。

术语

原文与代码

社区讨论

相关论文

全部论文解读