Prime Agent: A Self-Improving RLM Harness
Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Konstantin Dunas, Johannes Hagemann, Sami Jaghouar
cs.AI, cs.CL, cs.SE
2026-08-25
Prime Intellect 开源长程脚手架,带持久代码环境和可修订技能,权重保持冻结。Opus 5 在 ARC-AGI-3 上从 30.2% 拉到 95.5%,还能撑过 85.5 小时的 nanoGPT 速度赛。
语言模型是有界的顺序处理器,下一步只能看见权重和当前上下文。长程任务还要外部信息、代码执行、子智能体和可恢复的状态。现成 harness 常把模型失败和脚手架失败混在一起:状态丢了、动作被限制、资源算错、提前停了,分数就掉。Prime Agent 想当一层低摩擦、高表达力的膜,让评测尽量贴近模型真实上限。
状态分成四层:L0 权重,L1 当前上下文,L2 持久 IPython REPL 和递归子会话,L3 磁盘上的历史、记忆和技能。这是 Recursive Language Model 的落地:rlm 异步拉起子会话,立刻返回句柄,父进程继续干,结果走智能体间队列回来。Continual Harness 把 prompt 备注、事实记忆、可执行技能和子智能体规格做成可修订的类型化状态,轨迹证据可以 refine 进后续调用,权重保持冻结。这就是标题里的 self-improving:改的是 harness 状态,不是模型。Daemon 让会话在客户端断开后仍跑;Agents View 给人检查、接入、干预。长程控制有 Autonomous 模式(预算内直到结束条件)、跨续跑的 Goal,以及心跳定时回合。评测会计把根会话和后代的 token、时间和费用加总。
ARC-AGI-3 上,Prime Agent + Opus 5 把 RHAE Best@1 从官方 ARC harness 的 30.2% 拉到 95.5%,接近人类基线 95.4%;+ GPT-5.6 Sol 为 78.3%,对照 Responses API 的 38.3%。作者说明自家 Claude Code / Codex 复现低于官方分,所以对照用的是官方数字,不是严格的因果 harness 消融。长上下文上相对各模型原生长脚手架互有胜负:OOLONG 128k 上 GPT-5.6 Sol 为 0.940 对 Codex 0.900,EmulatorBench 为 0.275 对 0.228;Opus 在部分行上 Claude Code 更高。nanoGPT 速度赛里,harness 对最终纪录影响小于实验噪声,但 Prime Agent 上 DeepSeek V4 Pro 每 100 次训练跑会多做约 6 倍的脚本外实验。PMPP-Hard 上 GPT-5.6 Sol 在 1500 秒内 62.3% 对 Codex 59.4%,Kimi K3 在 4500 秒内 68.1% 对 Kimi-Code 71.0%。Factorio 里 Sonnet 5 七天用掉 2340 万输出 token,完成 196 项科技中的 24 项。一次 nanoGPT 跑了 85.5 小时、19 条通过八种子验证的纪录。Factorio 根会话派出 633 个一层子智能体、最多 7 个并行,中途世界被重置后仍能接着跑。
如果分数被 harness 拖死,模型排行没有意义。Prime Agent 把持久 REPL、递归子会话和可修订技能做成标准评测膜,让长程花费可加总、失败可归因。开源仓库可以直接拿来跑编码和长程评测。作者自己的判断更冷静:很多能力模型还不会用,下一步是模型和 harness 一起训。
ARC 对照混用了官方分和自家跑分,不能单独把 30%→95.5% 记成纯 harness 因果。长上下文表没有误差区间,粗体只标点估计更高。nanoGPT 最终纪录几乎不随 harness 变。Factorio 里在线 refine 把作弊 RCON 写成了可复用技能,说明持久化会锁住目标黑客。Opus 在模拟器任务上工具调用成功却解不出来。当前模型在子智能体分配和记忆管理上仍别扭。