SPADE:让智能体自己设计越来越难的 RL 环境,自博弈驱动环境扩展

_AndrewZhao · x · 2026-08-21

SPADE♠(Self-Play for Agentic Environment Scaling)提出让同一个模型分别扮演「环境设计者」和「推理智能体」进行自博弈:设计者持续生成可执行、难度随智能体能力提升而增加的 agentic 训练环境,形成环境的自我扩展(scaling)。作者认为这是通往 RSI(递归自我改进) 的关键一步——由 AI 自己决定训练什么、验证什么。团队透露正在扩展到终端任务等更多设定。背景引文指出:持续自我改进需要不断扩张的训练目标/环境供给,而 SPADE 让环境扩展自动化。

所属事件:SPADE 框架:单模型自博弈设计训练环境实现自我改进(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →