AREX: Towards a Recursively Self-Improving Agent for Deep Research
Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu
cs.AI
2026-07-24
AREX 抓住发现答案贵、验证答案便宜的不对称,用内循环做研究、外循环按置信度递归自改进;绝对分只是中游,卖点在消融里自改进贡献的约 23 分。
深度研究(deep research)要求答案同时满足多个约束。发现这种答案要在大搜索空间里试,很贵;但验证一个候选往往能拆成一串针对单个约束的检查,便宜。这种发现和验证的不对称说明研究智能体应该多做验证,并用验证结果驱动下一轮更聚焦的研究。只靠「搜得更久」不行,因为早期错误会留下来、方向会重复。
AREX 是双层递归过程。
内循环(研究)执行研究动作、整合证据、维护一条作为研究工作状态的轨迹。证据够了就输出一个临时答案、支撑证据和一个答案级置信度分。
外循环(自改进)评估临时结果。置信度过门槛就接受;否则判断轨迹能不能救(能就 Refine,不能就 Restart)。Refine 时保留已验证的发现,把没解决的问题转成下一轮的目标。
置信度分是证据接地信念状态的紧凑摘要,管终止;外循环让验证成为主动控制信号,递归修正研究状态,而不是最后才用的过滤器。
ACU(Autonomous Context Updating)是一个专门工具,把不断增长的交互历史压成紧凑的改进状态,保住已验证证据和未解约束。模型自己决定何时调它(比如解完一个有意义的子问题之后)。数据上,80.3% 的样本会调 updatecontext,平均在 25721 token 时调(远低于 128K 上限),66.9% 由「改搜索策略」触发,稳定保留未解约束(95.5%)、下一步计划(96.4%)、被否候选(81.5%)。finish 接口只外化答案、证据、置信度这三项外循环评估要用的东西。
训练是多阶段智能体中期训练:先建浏览密集的工具使用能力,再强化专家推理,避免互相干扰;关键步骤监督,分析显示关键步骤(第一个提供证据的工具调用、否掉错误假设、关键上下文更新)比普通步骤损失高 19 到 29%,训练集中压这些没学好的决策;步感知强化学习用回合级策略优化加分层归一化防止长轨迹占便宜,再给关键步加 bonus。
AREX-Base(122B-A10B MoE,10B 激活)在 BrowseComp 报告 82.5、GAIA 85.4、xbench-2510 71.0、DeepSearchQA 89.9、WideSearch-en 82.0。这个绝对分并不领先:Kimi-K2.6 在多项上更高(BrowseComp 83.2、xbench-2510 90.0、DeepSearchQA 92.5),MiroThinker-H1 在 BrowseComp 上 88.2、GAIA 上 88.5。AREX-Turbo(4B dense)的 BrowseComp 是 70.7。
这篇的真正卖点不是绝对分,是自改进机制的消融。BrowseComp 上,去掉 ACU 和外循环 59.6,加外循环 69.8,加 ACU 71.4,完整 AREX 82.5,自改进整体贡献约 23 分。训练消融:多阶段渐进训练换成混合训练掉到 77.5,关键步监督换成随机步回放掉到 74.1,步感知 RL 换成标准 GRPO 掉到 79.4。
把深度研究从「多搜几轮」变成「用验证信号递归修自己」,这个框架对做 agent 的团队直接有用:置信度门控、Refine 和 Restart、ACU 是可迁移的设计。训练侧的关键步监督(专压 loss 高的决策步)对做 agent RL 的人有参考价值。
绝对分要看清语境。BrowseComp 历史上对前沿模型很难,2026 年这一批模型整体把它推到 70 到 90 区间,AREX 的 82.5 在其中只是中游,所以别拿「BrowseComp 82.5」当 SOTA 卖点,真正的贡献是消融里那 23 分。系统跑在预设的最大轮数和置信度门槛下,这两个超参没做敏感性分析。关键步标注依赖有参考答案的可验证任务结构,训练时离线构造、评测时不带,但分布外任务的迁移没说清。附录里的轨迹自蒸馏(+4.8)没进最终配方,作者自己提醒会继承或放大教师偏置。