AREX-2:27B 反思型智能体 MLE-bench Lite 得 81.8 分
_akhaliq · x · 2026-10-02
AREX-2:长程反思任务推动自我改进智能体
新论文发布 AREX-2,一个 27B 参数的智能体模型,核心特点是「更多测试时轮次带来更好的解法」:
- 训练数据来自可验证的机器学习与算法任务,通过长程反思任务实现自我改进
- MLE-bench Lite 得分 81.8,Frontier-CS 得分 70.7
- 能力可迁移到 deep research 场景
这是把 test-time compute 转化为智能体性能提升的一次实证尝试。
所属事件:智源开源 27B 长程智能体 AREX-2,262K 上下文(5 条相关)→
「编程与Agent」频道最新
- MCP 闹钟应用创意:让 Agent 跑完任务后自动叫醒你 — Angaisb_ · 2026-10-02
- FDE 实战方法论:三源映射法在企业里部署 AI — vasuman · 2026-10-02
- Google Antigravity 密集更新,v2.17.0 到 v2.19.1 三版连发 — rseroter · 2026-10-02
- Seroter 每日阅读清单:agent 写码时代如何守住代码质量 — rseroter · 2026-10-02
- NYT 用 AI agent 检索 300 万页 Epstein 文件,产出十余篇报道 — dylfreed · 2026-10-02
- 工具层有 MCP、agent 层有 ACP,模型接口层为何没有标准协议 — Ikassam · 2026-10-02