递归研究智能体 AREX 4B 版本据称胜过 Qwen3.5-35B

imjustnewatai · x · 2026-07-26

中国研究团队发布了一个递归自我改进的研究智能体 AREX,它不是“一次生成答案就结束”,而是会反复审计每个断言、保留已验证的信息、把薄弱结论拆成新的检索任务,再继续循环搜索与改写。

帖子称,最小的 AREX-Turbo 只有 4B 参数,却在 6 个深度研究基准中的 5 个上超过 Qwen3.5-35B;更大的 AREX-Base 是 122B 总参数、10B 激活的 MoE,在文中报告的 6 项评测上都超过 Qwen3.5-397B,并拿到最高的 WideSearch-en 成绩。

文中还给出消融结果:

作者也强调,这还不是科幻意义上“模型自己重训自己”的递归自我改进,而是在研究过程中不断优化思考状态、策略和答案。

所属事件:中国团队发布递归研究智能体AREX(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →