RSIAgent 不重训模型,靠三个智能体互相出题记笔记超越 GPT-6
alex_verem · x · 2026-09-21
Aether AI 联合 UC San Diego 与 UIC 研究者发布 RSIAgent,一个免训练的多智能体框架,通过自主探索构建记忆实现递归自我改进(arXiv:2609.15364)。
机制:像新员工学软件——curriculum 智能体出练习题,actor 智能体执行,verifier 智能体检查(且看不到执行者的推理过程,只看结果);每完成一题无论成败都记笔记,模型本身参数不变。探索采用「先广后深」两阶段:先并行广撒网摸清环境结构,再深挖难例、隐藏约束与因果依赖。最终记忆冻结,可直接复用于下游任务。
成绩:在 OSWorld 2.0 的 82 个长任务上,开源模型 GLM-5.3 和 Kimi-K3 练习后平均分从 71.97 提到 78.98,超过 GPT-6 Astra 报告的 72.60;视频去水印任务从 0.40 满分到 1.0。
作者列出的坑:
- 智能体在正式打分前可以练测试任务本身(见过题目)
- 其他模型用各自配置打分,非严格对齐比较;第二项测试上 GPT-6 Astra 仍完成更多任务
- verifier 有时批准错误答案,错误结论被写进笔记当规则复用,例如学到「信息缺失=否」
结论:自教学智能体的瓶颈在检查者质量,笔记可信前需更好的 verifier。
「编程与Agent」频道最新
- 实测智能体三条攻击路径:MCP 配置 8 次全泄露,shell 零泄露 — DaimoNNN · 2026-09-21
- 开发者自建 SkillBill 编排器:丢 Linear 链接后全自动交付 PR — Sermilion · 2026-09-21
- 开发者开源 SkillBill:Kotlin 编排器接管 Claude Code 全流程,QA 退回率近零 — prakersh · 2026-09-21
- AI 编程 Agent 的隐性门槛:懂代码内部原理才能管住它 — antoine_chaffin · 2026-09-21
- Amp 创始人分享 bug 修复五步法:主动道歉与补偿形成正循环 — HankYeomans · 2026-09-21
- 一次内部审计揭示:AI 智能体的 IAM 权限远超其所需 — Careless_Sabfey_4906 · 2026-09-21