BAAI AREX-2:用长程反思数据训练自我改进智能体,GAIA 达 92.2
BAAI · hf · 2026-10-01
BAAI 发布 AREX-2,瞄准 LLM 智能体的测试时自我改进能力,拆解为反思(产出比当前更好的解)与长程执行(多轮迭代不失效)两种能力,并假设二者与领域无关、可在反馈可验证的领域习得。
- 从机器学习与算法编程任务合成长程改进轨迹,训练基于 Qwen3.8-27B 的智能体
- MLE-bench Lite 81.8,Frontier-CS 70.7
- 迁移到深度研究:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8
- 随迭代轮数预算增加性能持续提升,证明长程反思数据是通往自我改进智能体的有效路线
「编程与Agent」频道最新
- 不用 Fable 纯跑 Opus 4.5,不到两天烧完 Claude 周额度 — yihui_indie · 2026-10-01
- 双模型分工实操:Opus 管架构审查,Sol 负责大量编码 — haider1 · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01
- a16z 工程合伙人:用 Codex 控管多账号 DM 和收件箱,完胜邮件 API — ericjang11 · 2026-10-01
- 为何 Agentic 推理需要 P/D 分离:30 万行代码库场景下的延迟拆解 — abhijithneil · 2026-10-01
- Meta RankEvolve:多 Agent 互查把自动研究执行准确率提至 62.5% — _reachsumit · 2026-10-01