BAAI 的 AREX 用递归验证改进深度研究答案
BAAI · hf · 2026-07-24
核心思路
AREX 提出一种“递归自我改进”的深度研究智能体:先在内层循环里搜集证据、形成临时答案,再在外层循环里按约束逐项审计,找出未解决的主张并定向继续检索。
主要创新
- 提出一个自主的上下文更新工具,把不断增长的交互历史压缩成紧凑的“改进状态”,同时保留已验证证据和未决约束,而且不依赖外部模型。
- 训练方式结合了验证过的合成任务、高质量轨迹、agentic mid-training 和长程强化学习。
- 为缓解长程任务里的稀疏终局奖励,训练时特别强调“拿到决定性证据”或“纠正错误研究方向”的关键步骤。
结果
- 实现了一个4B 稠密模型和一个122B-A10B MoE 模型。
- 在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE) 等推理与工具使用基准上表现突出。
- 论文称,AREX 在同规模基线之上有明显提升,并且能接近那些激活参数更多的模型。
所属事件:BAAI 推出 AREX 双循环自改进研究智能体(2 条相关)→
「研究」频道最新
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27