AetherAI 提出 RSIAgent:零参数更新让开源模型 Agent 反超闭源
机器之心 · wechat · 2026-09-15
因果智能公司 AetherAI 发布 RSIAgent 论文,主张另一条 Scaling 路线:不 Scale Model,而是 Scale Experience——模型参数不动,让 Agent 自主探索新环境、沉淀因果经验并持续自我提升。
核心框架
- 围绕一个不断演化的 Memory,构建 curriculum agent(决定探索方向)、actor agent(执行任务)、verifier agent(依据真实环境反馈验证)三智能体递归闭环。
- 两阶段策略:Broad Recursive Self-exploration 类似预训练,并行生成多方向任务快速建立环境知识地图;Deep Recursive Self-exploration 类似后训练,顺序递归地刻意攻击难点、隐藏约束与边界情况。
- 探索结束后 Memory 冻结,直接复用于下游任务。
实验结果
- 不更新参数的情况下,GLM-5.3 与 Kimi-K3 在 OSWorld 2.0 上从 71.97% 提升至 78.98%,超过 GPT-6 Astra(72.60%)与 Claude Opus 5;在 Agents' Last Exam(Near-term)达 84.82%。
- 泛化到 GameCraft-Bench 自主游戏开发任务同样有效;部分初始成功率仅 0–40% 的任务随 RSI 轮次增加最终可达 100%。
- 消融实验证明 Broad 与 Deep 两阶段缺一不可。
论文、代码与项目页均已公开。团队称这是其「通用因果智能」路线的一环:让 AI 理解「什么改变导致什么结果」,而非只记住相关性。
所属事件:AetherAI 发布 RSIAgent:免训练实现智能体自我改进(2 条相关)→
「编程与Agent」频道最新
- 和 Devin 聊到被妈妈撞见,AI 编程员日常成梗图 — marvinvonhagen · 2026-09-15
- 买断制 AI 排程工具 Social Quack 上线:MCP 接 Claude 自动发社媒 — ThePeterMick · 2026-09-15
- 一句话让 AI 修好 macOS 升级后崩掉的 App,10 分钟交付新构建 — intellectronica · 2026-09-15
- 开发者开源 Orca 编排工具,简化多智能体 SDLC 工作流配置 — Long_Philosopher3520 · 2026-09-15
- MCP 服务器更新后能力漂移怎么防?快照清单加 diff 审查方案引热议 — daani_maas · 2026-09-15
- Brex CEO 主张别做 Agent 做 AI 员工:卖工作成果而非卖软件 — petergyang · 2026-09-15