会给自己打分还不够,S3Gym上参数训练会把PvZ从23分打到6分

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang

cs.CL

2026-09-01

S3Gym用七个可验证游戏拆开自测、自判、自改进。摘要适合可压缩规则,局部盘面更吃原始历史。Qwen3-8B训练把Trust从0拉到30,却把PvZ从23打到6。

这篇在解决什么

Agent 基准大多把模型当成固定策略:给任务、给环境、看这次能不能做完。真实部署里更常问的是另一件事:模型能不能自己试、自己判、再把经验变成下次更好的行为。收集轨迹不等于会学习。经验要经过检验、抽象,再拿去用。

S3Gym 把这条链拆成 Self-Testing、Self-Judging、Self-Improvement,并故意把环境真分藏起来。探索阶段规则更松,评估阶段更严、种子不重叠。Agent 必须靠自己打的分来整理经验,基准再用可执行校验器量它到底有没有变强。

方法

七个可程序验证的文字游戏覆盖不同结构:Chess、Minesweeper、Nullify、Tetris、Snake、Plants-vs-Zombies、Trust Evolution。探索更宽松,评估更严,例如扫雷探索有两条命、评估一雷结束;贪蛇探索撞墙当空操作、评估直接终止。

每步模型同时给动作和自我即时分。环境返回可观察反馈,校验器分数只留在基准侧。经验走三条路:

主实验评 GPT-4o、GPT-4.1、o3-mini、Gemini-2.5-Flash/Pro、GPT-5.5、Gemini-3.5-Flash。探索 30 局,每 3 局在严格配置上评 3 局。指标是全程均分、峰值和高于起点的正面积 AUC+。训练路径另用 Qwen3-8B,20 个 checkpoint,评估时不再给历史或摘要。

结果

上下文级改进既不自动,也不均匀。摘要在规则可压缩的游戏里有用:Tetris、Nullify、Trust 上 Summary 的平均 NABA 更好。依赖局部盘面的 Minesweeper、PvZ、Snake,原始历史往往更强。GPT-5.5 的 PvZ AUC+ 从 History 的 548.499 掉到 Summary 的 33.219;Gemini-3.5-Flash 的 Chess AUC+ 从 12.280 掉到 0。

自我打分只是半可靠。98 次运行、116117 个转移上,Chess 事件一致率 0.496,过自信 0.365;PvZ 一致率 0.881,但归一化绝对误差 0.882,量纲完全没校准。判断质量与下一检查点的分数变化几乎无关,ρ(A,g)=−0.010。

Qwen3-8B 训练在 Trust Evolution 上从 0 拉到最高 30,19 个更新点里 18 个高于起点,AUC+ 163.5。扫雷、Nullify、Tetris 全程 0。PvZ 从 23 掉到每个更新点都是 6,负迁移写得很清楚。贪蛇偶尔摸到 1 分,随后回到 0。

为什么重要

对做自我改进 Agent 的人,这份基准把「会打分」和「会变强」拆开了。本地判断准,下一步未必更好;摘要在能写成稳定规则时值钱,在要精确状态时会把关键细节压没。参数更新能内化策略,也能把探索里学歪的东西写进权重。

和 Reflexion、Voyager 那些展示单一机制的工作不同,S3Gym 在同一环境和同一预算下并排三条路,评估还换更严的配置。结论偏诊断:缺的是把反馈变成可执行、可迁移策略的那一步。

局限与存疑

游戏分制差几个数量级,AUC+ 不能跨游戏加总,作者也这么说。主表只收齐了七个游戏的专有模型,训练路径只有 Qwen3-8B 一条,看不出换模型训练是否同样不稳。探索和评估的配置差是人为设计的难度跳,负迁移有多少来自这一跳、有多少来自错误判断,没有拆开。

自我分与环境分的耦合分析是相关不是因果。Chess 只有 5 步、15×15 再评 22 子,和真下棋不是一回事,更像短horizon 的状态预测。没有人类玩家或专用 RL 基线,绝对分不好解释。

术语

原文与代码

相关论文

全部论文解读