SPADE 自博弈生成训练环境助模型自我进化

SPADE 是一种自博弈强化学习框架,让语言模型同时扮演环境设计师和推理智能体,自行编写并解决可执行的训练环境。借助基于悔恨(regret)的环境定位机制,环境难度随模型能力提升自动增加,无需人工扩展即可持续自我改进,实验显示该框架有效提升了模型的推理与工具使用性能。

2026-08-20 ~ 2026-08-20 · 2 条相关