RSIAgent 论文:免训练自改进框架让开源模型击败 GPT-6 等闭源模型

rohanpaul_ai · x · 2026-09-25

arXiv 论文《RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments》(Sibo Zhu 等,50 页)提出免训练的多 Agent 递归自改进框架:协调课程(Curriculum)、执行(Actor)与校验(Verifier)三类 Agent,持续探索环境、验证结果,并将「行动-条件-后果」因果知识沉淀为可复用记忆。

关键设计是「先广后深」(broad-then-deep)探索:先并行广泛自探索发现环境结构,再聚焦深挖难例、隐藏约束、边界条件与未知因果依赖。产出的记忆冻结后可直接用于下游任务,无需更新模型参数。

在 OSWorld-v2 与 Agent's Last Exam 上,该框架显著提升强开源模型表现,使 Kimi-K3 和 GLM-5.3 超越 GPT-6 等前沿闭源模型。

所属事件:RSIAgent 免训练自改进框架让开源模型胜过 GPT-6(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →