SPADE 框架:自博弈设计可执行环境提升推理能力

Bo Liu · hf · 2026-08-20

SPADE 是一种自博弈强化学习框架,语言模型在其中设计自适应的可执行训练环境并尝试解决。通过基于悔恨的环境定位,该框架有效提升了模型的推理和工具使用性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →