SPADE 自博弈生成训练环境助模型自我进化
SPADE 是一种自博弈强化学习框架,让语言模型同时扮演环境设计师和推理智能体,自行编写并解决可执行的训练环境。借助基于悔恨(regret)的环境定位机制,环境难度随模型能力提升自动增加,无需人工扩展即可持续自我改进,实验显示该框架有效提升了模型的推理与工具使用性能。
2026-08-20 ~ 2026-08-20 · 2 条相关
- SPADE 框架:自博弈设计可执行环境提升推理能力 — Bo Liu · 2026-08-20
- SPADE 自动生成训练环境,AI 实现持续自我进化 — pliang279 · 2026-08-20