RSIAgent 不重训模型,靠三个智能体互相出题记笔记超越 GPT-6

alex_verem · x · 2026-09-21

Aether AI 联合 UC San Diego 与 UIC 研究者发布 RSIAgent,一个免训练的多智能体框架,通过自主探索构建记忆实现递归自我改进(arXiv:2609.15364)。

机制:像新员工学软件——curriculum 智能体出练习题,actor 智能体执行,verifier 智能体检查(且看不到执行者的推理过程,只看结果);每完成一题无论成败都记笔记,模型本身参数不变。探索采用「先广后深」两阶段:先并行广撒网摸清环境结构,再深挖难例、隐藏约束与因果依赖。最终记忆冻结,可直接复用于下游任务。

成绩:在 OSWorld 2.0 的 82 个长任务上,开源模型 GLM-5.3 和 Kimi-K3 练习后平均分从 71.97 提到 78.98,超过 GPT-6 Astra 报告的 72.60;视频去水印任务从 0.40 满分到 1.0。

作者列出的坑:

结论:自教学智能体的瓶颈在检查者质量,笔记可信前需更好的 verifier。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →