Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li
cs.LG, cs.AI, cs.CV
2026-08-18
多个互不共享参数的模型用同伴多数票当奖励做强化学习。七项文本基准平均涨 3.0–8.6 分,无标签也能追上有监督。
可验证奖励的强化学习把模型推理做上去了,但奖励绑在标准答案上。题越难,答案越贵,人类也越评不准。自奖励路线把标签拿掉了:TTRL 用自己的多数票,Intuitor 用自信度,RENT 用熵。监督信号仍来自正在被优化的那一个模型。错得系统,奖励就把错的再钉死。训得一长,多样性塌,奖励崩。
Co-RL 问的是一件更窄的事:没有标准答案时,学习信号从哪来才够独立,才不会把自己的偏见放大回去。
把 1998 年 co-training 的想法搬进 GRPO。两个或更多模型不共享参数、不交换梯度,同时对着同一批无标签题采样。每个 agent 自己滚出 K 条回答,抽出最终答案做多数票,得到一份伪标签。这份伪标签只拿去给另一个 agent 打分:跟同伴多数票一致得 1,否则得 0。两个 agent 时互相打;三个以上时伪标签沿有向环传。
多样性是刻意堆的,三层。
理论把答案压成对或错两种结果。自奖励的更新方向由自己当前更可能的答案决定:正确概率小于二分之一时,训练会把正确答法继续压下去。Co-RL 里 A 的更新方向由 B 的多数票决定。两人正确概率之和大于 1,就会一起被拉向正确答案。同伴只要在你错的那部分题上对了,就能把你拽回来。
3B 文本实验在 MATH 3–5 级无标签题上训,评测覆盖数学、代码、科学七项。
| 模型 | 基线平均 | TTRL | 有监督 GT-Reward | Co-RL 最强变体 |
| Qwen2.5-3B | 40.7 | 47.3 | 47.4 | 49.3(异族+改写) |
| Llama-3.2-3B-Instruct | 38.7 | 43.1 | 43.0 | 43.9(异族+改写) |
同族两副本已经有用:Qwen2.5-3B 平均加 8.0 分,Llama 加 4.0 分。换成异族再加题面改写,Qwen 到 49.3,超过有监督的 47.4。7B/8B 同样:Qwen2.5-7B 从 49.0 到 53.6,Llama-3.1-8B 从 44.7 到 47.7,后者也超过有监督的 47.1。四台语言模型的平均增益落在 3.0 到 8.6 分。
按 CoMAS 协议对比多智能体 RL,Co-RL 平均 62.97,CoMAS 58.94,高 4.0 分,agent 数量减半,也不用额外的大模型裁判。三个异族模型同训时,各自平均涨 7.8、6.0、8.2 分,全部追上或超过各自的有监督对照。
视觉语言模型上,2B 到 12B、四个多模态数学基准平均涨 2.3 到 7.2 分。Gemma-3-12B 无标签 47.56,有监督 45.17。训练曲线上,自奖励会出现奖励方差塌、长度退化甚至发散;Co-RL 的组内奖励方差和完成长度更稳。
无标签推理强化学习现在有一条可复现的路径:别跟自己玩,找一个错误结构不同的同伴。同族两副本已经够用,跨族加题面改写更稳。代价是一次训两个或三个模型,论文用单机八张 H100、每 agent 四张。对已经在跑 TTRL 或 GRPO 的团队,改奖励来源比改优化器便宜。伪标签只看最终答案对不对,适合数学和代码这种能抽出答案的任务;开放式写作还走不通。
奖励仍是最终答案是否等于同伴多数票,中间推理链对不对没有单独监督。同伴一起错,伪标签照样错。理论把答案压成对错二分类,真实题面的错误模式更碎。训练算力接近翻倍,论文没有系统扫描 agent 数量和拓扑。三模型那组的 HumanEval 上,Qwen3-1.7B 的 Co-RL 是 64.2,低于有监督的 70.1,互补性不是免费午餐。InternVL3.5-2B 在 MMR1 上 Co-RL 平均 45.15,略低于 TTRL 的 45.30,跨模态不是每张表都赢。