ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction
Yongqi Tong, Tan Li Hui Faith, Choy Zhen Wen Marcus, Zhou Jin, Kewei Fu, Jiang-Ming Yang, Jianshe Li, Xin Zhang
cs.AI, cs.CL
2026-08-13
开放交互里直接答、先澄清、边跑边汇报都合理,GRPO混组比较会被奖励模型风格偏好带偏。ARC按策略分组。Qwen3-8B上GRPO+ARC的τ-airline从31.33升到44.00。
GRPO 这类组内相对强化学习,默认同一组 rollout 在比质量。开放交互把这个假设拆掉:同一轮用户状态下,直接给答案、先问清楚、工具跑着先汇报进度、不可逆操作前再确认,都可能是对的。奖励模型对长度和文风本来就有偏好,跨策略一减均值,优势里就混进「哪种说话方式更讨奖励模型喜欢」,优化会被推去奖励偏好的交互风格,而不是当时该用的策略。
蚂蚁国际把这叫做奖励公平问题,做法叫 ARC:训练时给每条样本贴一个策略指令,只在同一策略组里采样和算相对优势,推理时把指令拿掉,让策略自己选。配套的交互壳是 INTER3,把用户看得见的回复和内部推理、工具调用拆开,进度更新、澄清、中途打断才能被标出来、被分组。
INTER3 把 <answer> 片段流给用户,标签外当隐式推理,工具调用仍是内部动作。实现改动很小:分词器加标签,生成后再抽出可见片段。相对 think 完再答,用户不用等整条内部轨迹结束。策略分成四大家族:进度更新、先澄清、对齐确认、直接作答,底下再拆成九个具体策略。
数据 INTER3-86K 共 86796 条。SFT 57900 条,工具调用 34200、多跳问答 17200、逻辑推理约 6400,由 Qwen3.5-397B 改写成交错格式。RL 28900 条全是工具数据,每条由双模型标注一个合理策略再写入系统提示。RL 集里进度更新占 75.3%,对齐确认只有 2.5%。一部分轨迹来自大型支付平台客服的真实在线交互。
ARC 的四步:贴策略、组内采样、组内算优势、带熵正则更新。没有熵奖励时,策略会塌成空的 <answer> 刷格式分。主实验用 Qwen3-8B、无 think 的 GRPO,奖励是格式分加工具对错加(仅工具正确时才发的)答案裁判分。
主增益在域内工具调用,而且高度依赖底座优化器。
| 方法 | 平均 | τ-airline | τ-retail | τ²-airline | AIME 2026 |
| Qwen3-8B-Think | 32.82 | 28.00 | 36.81 | 29.75 | 47.92 |
| GRPO | 28.09 | 31.33 | 40.29 | 36.67 | 31.67 |
| GRPO+ARC | 33.46 | 44.00 | 50.00 | 48.00 | 40.83 |
| PPO+ARC | 28.57 | 39.33 | 46.09 | 41.61 | 19.17 |
GRPO+ARC 平均 +5.37;PPO 和 DAPO 只加 1.08 和 1.31。PPO 加上 ARC 之后 AIME 从 30.83 掉到 19.17,域外不是免费赠品。4B 上 GRPO+ARC 的五任务均分 34.23,对应 GRPO 只有 22.33。相对 think 基线,INTER3 把首 token 从 4.91 秒压到 GRPO+ARC 报的 1.27 秒;同一张表里纯 GRPO 是 0.61 秒,ARC 变体略慢。
训练时一直留着策略指令最好,线性退火和固定 20% 丢掉都会伤 τ / τ²。推理时再塞匹配或随机策略提示,总分 39.85 和 39.58,都低于不给提示的 41.73。策略指令是训练期的比较类,不是部署期的开关。四种策略齐上时平均 29.59,只留进度更新是 21.74,τ 均分从 23.62 到 47.00。
在开放 agent 上跑组相对 RL 的人,这篇把一个常被当成「奖励模型不够好」的现象,收成比较集构造问题。换更强裁判、加熵、换 PPO,都没碰到「不同策略被放进同一组」这件事。ARC 几乎不改优化器,只改谁和谁比。代价是要有策略标签,以及一个能把可见回复和内部执行拆开的运行时。
适合已经在用 GRPO 做多轮工具 agent、并且交互风格确实多样的场景。如果任务接近唯一标准答案的短推理,组内本就可比,收益会小,PPO 那组数字就是提醒。
策略分类很粗,真实对话里的策略更碎、更随上下文变。最强数字集中在工具调用,换域有没有同样不公平的比较,没测。标注主要靠两个大模型对打,人只在低置信分歧时介入,标签会带进模型对「什么叫合适策略」的偏见;进度更新又占 RL 数据的四分之三,少数策略的增益可能被高估。理论部分是估计器方差的示意分解,论文自己写了不是 GRPO 的收敛保证。客服轨迹来自支付平台,策略分布未必能搬到别的产品。