BAAI 的 AREX 用递归验证改进深度研究答案
BAAI · hf · 2026-07-24
核心思路
AREX 提出一种“递归自我改进”的深度研究智能体:先在内层循环里搜集证据、形成临时答案,再在外层循环里按约束逐项审计,找出未解决的主张并定向继续检索。
主要创新
- 提出一个自主的上下文更新工具,把不断增长的交互历史压缩成紧凑的“改进状态”,同时保留已验证证据和未决约束,而且不依赖外部模型。
- 训练方式结合了验证过的合成任务、高质量轨迹、agentic mid-training 和长程强化学习。
- 为缓解长程任务里的稀疏终局奖励,训练时特别强调“拿到决定性证据”或“纠正错误研究方向”的关键步骤。
结果
- 实现了一个4B 稠密模型和一个122B-A10B MoE 模型。
- 在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE) 等推理与工具使用基准上表现突出。
- 论文称,AREX 在同规模基线之上有明显提升,并且能接近那些激活参数更多的模型。
所属事件:BAAI 推出 AREX 双循环自改进研究智能体(2 条相关)→
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11