J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
Gyouk Chu, Myeongho Jeon, Eunho Yang
cs.LG, cs.AI, cs.CL
2026-08-27
KAIST的J-Zero让出题、答题、打分三个角色从零数据共进化:可验证域平均比R-Zero/G-Zero高4.2分,不可验证域高8.0分,十轮仍涨而基线两轮后掉。
零数据自博弈已经能在数学、代码这类「答案能验」的任务上自己出题、自己练。一个模型分饰 Challenger(出更难的题)和 Solver(把题做对),奖励来自执行器或多数投票。开放式写作、建议、创意任务没有标准答案,这条路就断了。
现有补丁是塞一个冻结的 Judge(奖励模型)去打分。Solver 很快把这个 Judge 能分辨的差别吃干,之后奖励信号变平,迭代两轮就开始掉点。R-Zero 靠多数投票,本来就走不出可验证域;G-Zero 用 Challenger 的提示构造偏好对、再用 DPO 训 Solver,干脆不用 Judge。两边都把评估能力当成常量。J-Zero 的论点更硬:自进化能走多远,取决于评估器当下能看见什么,评估器也必须一起涨。
KAIST 这套循环每轮三步。Challenger 和 Solver 都用 GRPO 更新,Judge 用 Bradley-Terry 损失。GRPO 是组内相对优势的策略优化,Bradley-Terry 学的是成对「谁更好」,不是绝对分。
硬约束是标签不能来自 Judge 自己,否则只会把偏见放大。外部 LLM(Claude Opus 4.8)核对这些自造标签:角色不对称对从第一轮起胜率就超过 60%,从 87.9% 降到约 66%,难度上去后两边都变弱,差距缩小;子任务放大前三轮胜率不到一半,第一轮只有 21.1%,第四轮起超过 50%,后期到 70%–80%。两条曲线在训练中段交叉,Judge 全程有可用信号。
底座是 Qwen3-4B-Base 和 Qwen3-8B-Base,Judge 初始化为 Skywork-Reward-V2-Llama-3.1-8B。每轮 Challenger 5 步、Solver 15 步、Judge 8 步。对照是未训练底座、R-Zero、G-Zero。
| 设置 | 可验证域总分 | 不可验证域总分 |
| Qwen3-4B 底座 | 44.91 | 9.58 |
| R-Zero | 49.64 | 12.66 |
| G-Zero | 47.41 | 10.89 |
| J-Zero | 54.38 | 20.81 |
| Qwen3-8B 底座 | 50.67 | 13.23 |
| R-Zero | 54.99 | 15.54 |
| G-Zero | 53.07 | 15.31 |
| J-Zero | 58.55 | 23.41 |
4B 上,AIME25 从 6.67 到 15.83,BBH 从 50.88 到 70.85,AlpacaEval 2.0 从 6.22 到 28.56。摘要里相对基线平均 +4.2 / +8.0,跟表里相对 R-Zero 的 4.74 / 8.15 对得上。冻结 Judge 的消融在可验证域掉到 52.72、不可验证域掉到 16.37;去掉子任务放大整体掉 1.64,去掉角色不对称掉 0.97。R-Zero 和 G-Zero 在第 2 轮见顶后下滑,J-Zero 到第 10 轮仍单调上升。Judge 在无关的奖励模型基准 RM-Bench 上从 92.61 到 93.95,其中 Hard 对从 85.08 到 89.85。
开放式任务上,冻结奖励模型是自博弈的天花板,不是实现细节。把 Judge 放进闭环,而且标签来自角色结构和分治、不来自它自己的分数,这条路才不会把偏见越训越深。对想做持续自我改进的团队,可复用的不是三个角色的名字,是「偏好标签必须独立于当前评估器」。代码和权重已公开。规模停在 8B、只用 base 模型,还不能直接当成生产后训练配方。
论文自己写了:算力把 Challenger/Solver 限制在 8B,Judge 也是 8B 分类式奖励模型,没有测过带长思维链的后训练推理模型。三个角色没有共享同一个生成式初始化,生成式 Judge(LLM-as-a-judge)怎么在闭环里共适应仍是开放问题。
另外几处读下来要打折。不可验证域的评测本身用更强的 LLM 当裁判,跟训练用的 Judge 不是同一套标准,增益有多少是「更会讨好评测裁判」不好拆开。角色不对称标签的胜率随难度下降,后期信号变弱,全靠子任务放大接盘;如果拆题质量不稳,这个接盘会空。G-Zero 对照保留了原文的 LoRA 和大 Challenger batch,论文说改成全参或缩小 batch 会更差,公平性仍可争。没有人类偏好抽检,外部裁判是 Claude Opus 4.8 一家。