SPADE 框架:自适应合成环境中的自我博弈

_AndrewZhao · x · 2026-08-21

论文提出 SPADE (Self-Play in Adaptive Synthetic Executable Environments),这是一个通过自我博弈让 LLM 持续自我改进的框架。LLM 在其中扮演两个角色:编写可执行训练代码(含 reset/step 接口、状态转移与奖励函数)的“环境设计师”,以及在环境中行动的“推理 Agent”。该框架通过优化 Agent 的“遗憾”(regret)信号,让环境设计师学会生成处于 Agent 能力边缘的适应性目标,从而解决传统静态环境导致的目标分布固定问题,提升 Agent 的多样性与记忆能力。

所属事件:SPADE框架自博弈设计环境驱动AI自我进化(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →