SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques
ICLR 2026
cs.AI, cs.CL, cs.LG
2025-07-01
SPIRAL让模型在井字棋、Kuhn Poker和谈判里自我对弈,Qwen3-4B-Base八项推理从34.0%升到44.5%,超过2.5万条专家对局SFT;无RAE时思维链会塌缩,Instruct模型只涨2点。
o1、R1 这类模型靠可验证奖励把思维链拉起来,但题和分都得人准备。换一个领域就要重新出题、写规则、核答案。自博弈在围棋和 Dota 上证明过「对手变强、数据自己长」,落到语言模型上,先前工作多半是单轮、离线更新,或只在文字禁忌游戏里打转。
SPIRAL 要问的是:让模型在零和、多回合语言游戏里打自己,数学和知识题会不会一起涨。训练时完全不碰这些 benchmark 的题。
环境来自 TextArena 的三个两人零和游戏:井字棋(空间)、Kuhn Poker(概率,三张牌的简化扑克)、Simple Negotiation(议价)。同一套参数扮演双方,用系统提示区分角色。奖励只在终局给 +1/0/−1,中间步没有 shaping。
优化是带基线的 REINFORCE。零和里两个角色的期望回报本来就不一样,先手优势、信息不对等都在。他们提出 Role-conditioned Advantage Estimation(RAE):每个游戏、每个角色维护一个指数滑动平均基线,用终局回报减这个基线当优势。没有 RAE 时,大约 100 次策略迭代后思维痕迹从约 2000 字符塌到接近空,模型开始直接输出 boxed 动作,综合推理从 44% 掉到 40%。加上 RAE,回复长度稳在 1300–1500 字符,分数从 40% 升到 47%。摘要把塌缩时刻写在约 200 步。
系统是在线 actor-learner:vLLM 采样,TextArena 推进,Oat 做分布式更新。400 步、每步 128 条、8 张 H100、学习率 1e-6。对照包括 2.5 万条由 Qwen3-32B 生成的专家对局 SFT,以及固定对手(随机、Mistral-Small-3、Gemini-2.0-Flash-Lite)。
多游戏 SPIRAL 在四类模型上都涨,涨幅差很大:
| 模型 | Base 平均 | SFT-Multi | SPIRAL-Multi |
| Qwen3-4B-Base | 34.0 | 39.7 | 44.5(+10.5) |
| Qwen3-8B-Base | 39.5 | 46.1 | 49.6(+10.1) |
| Octothinker-8B-Base | 25.8 | 27.0 | 33.8(+8.0) |
| Llama-3.1-8B-Instruct | 23.9 | 25.0 | 25.9(+2.0) |
| DeepSeek-R1-Distill-Qwen-7B | 60.4 | 58.3 | 61.8(+1.4) |
Qwen3-4B 上,AMC-23 从 42.4 到 61.6,AIME24 从 9.6 到 19.7,MATH500 从 73.4 到 78.2。已经做过 RLVR 的 Distill-7B 还能再涨一点,SFT 反而把这个模型拉下去。
固定对手会饱和:打 Gemini 的胜率从 0% 爬到 62.5%,说明在刷可剥削策略;自博弈对 16 步前的自己,胜率一直贴在 50%–52%。随机对手几乎学不到东西。
用 GPT-4.1 去标 290 条游戏轨迹和 46792 条数学解答。分情形讨论从游戏到数学的迁移接近保住(72% 到 71%),模式识别还放大了(35% 到 45%),期望值计算迁移更挑题目(78% 到 28%)。单游戏专才在同类 OOD 游戏上更强(扑克专才在 Pig Dice 上 91.7%),三游戏一起打 Gemini-2.0-Flash 的平均胜率 59.5%,高于最强单游戏专才的 52.9%。
这是目前把「语言模型在线、全参数、多回合自博弈」跑通的少数实现之一,代码也开了。对想做无标注推理 RL 的人,RAE 比游戏本身更值得抄:角色不对称会把普通 REINFORCE 带进思维塌缩。
诚实讲,这是迁移实验,不是新的通用智能路径。井字棋和 Kuhn Poker 都很浅,Instruct 模型和已经 RLVR 过的模型涨幅只剩 1–2 个点。
没有单独的 Limitations 节。游戏集合小、规则确定、部分可观察性很弱。数学分数用 LLM 去标「出现了某种推理模式」,相关不等于因果。8 个推理基准高度偏数学,MMLU-Pro 和 GPQA 的涨幅不能自动推广到写代码或长工具调用。Llama Instruct 只加 2.0,说明方法对已经对齐过的模型帮助有限。致谢里写了 DARPA/AFRL 合同,和正文实验无直接关系,但论文没讨论游戏自博弈会不会学到有害的对抗策略。