递归研究智能体 AREX 4B 版本据称胜过 Qwen3.5-35B
imjustnewatai · x · 2026-07-26
中国研究团队发布了一个递归自我改进的研究智能体 AREX,它不是“一次生成答案就结束”,而是会反复审计每个断言、保留已验证的信息、把薄弱结论拆成新的检索任务,再继续循环搜索与改写。
帖子称,最小的 AREX-Turbo 只有 4B 参数,却在 6 个深度研究基准中的 5 个上超过 Qwen3.5-35B;更大的 AREX-Base 是 122B 总参数、10B 激活的 MoE,在文中报告的 6 项评测上都超过 Qwen3.5-397B,并拿到最高的 WideSearch-en 成绩。
文中还给出消融结果:
- 自主上下文更新带来 +11.8 分
- 外层递归审计再带来 +11.1 分
- 两者合计提升 +22.9 分(BrowseComp)
作者也强调,这还不是科幻意义上“模型自己重训自己”的递归自我改进,而是在研究过程中不断优化思考状态、策略和答案。
所属事件:中国团队发布递归研究智能体AREX(2 条相关)→
「模型」频道最新
- 前沿模型迭代太快,单个模型几乎没有护城河 — 0xsachi · 2026-07-26
- 一个项目让开发者相信,Agent harness 比模型更重要 — alexcovo_eth · 2026-07-26
- OpenAI 的 GPT-6 与 RSI 传闻补齐证据链 — imjustnewatai · 2026-07-26
- OpenAI 的 GPT-6 可能是会自我改进的记忆型系统 — imjustnewatai · 2026-07-26
- 对比帖称 Fable 5 比 Opus 5 更快也更便宜 — bindureddy · 2026-07-26
- 对比 Google TPU、Gemini 与 xAI 的 10T 训练说法 — imjustnewatai · 2026-07-26