From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL
Wenyue Hua, Zachary Huang, Tyler Payne, Safoora Yousefi, Saleema Amershi, Asli Celikyilmaz
cs.AI, cs.CL, cs.LG, cs.MA
2026-08-14
微软对 Qwen3-4B 做六域谈判专项 RL,统一模型平均效用 0.627 超过 GPT-5.1,买家压价开局从 3% 升到 78%。
越来越多 agent 替用户出面办事:约会议、比价、砍价。坐在对面的是另一方的 agent、卖家或猎头,利益与委托人不一致。问题在于,让助手好用的那些秉性放在谈判桌上全是漏洞:微软的测量里,前沿模型会主动泄底,对方一抵抗就让步。RLHF 训出来的是合作对话里的顺从,撑不起冲突利益下的坚持。
微软研究院的 SocialRL 把「社交推理」直接当训练目标:在六个谈判与协调环境里对 Qwen3-4B-Instruct-2507 做专项后训练,验证小模型能不能靠针对性训练拿到通常靠规模撑起来的谈判能力。
六个环境覆盖四类结构:Deal-or-No-Deal 和 CaSiNo 是多议题分配,Craigslist 和 Marketplace 是单议题价格谈判,Job Interview 是五议题合同谈判(每个场景约 10^4 种组合),Calendar 是时段协调。奖励只有终端一个标量,全部归一化到 [0,1]:分配类对照帕累托前沿上的无嫉妒参考点,价格类按议价走廊算剩余瓜分,Calendar 按可行时段的偏好极差。
训练分两阶段。第一阶段每个环境各训一个专家:四个环境直接 PPO(Qwen3-1.7B critic,最多 200 步),两个价格环境先 SFT 热启动再 PPO,因为基础模型几乎探索不到锚定行为。第二阶段把专家合成一个模型,两条路:级联 RL 按迁移结构排环境顺序串行训;MOPD(多教师在线蒸馏)让学生自己在环境里 rollout,教师专家对生成响应出 token 级 logits,reverse-KL 蒸馏,并按「教师优势还剩多少没吸收」动态分配采样预算。
迁移结构是先测出来的:六个专家在全部六个环境上交叉评测,得到 6×6 迁移矩阵,级联顺序就按矩阵排。
| 配置 | DnD | CaSiNo | Craigslist | Job Int. | Calendar | Mkt | 平均 |
| 基础 4B | 0.583 | 0.476 | 0.318 | 0.479 | 0.301 | 0.174 | 0.389 |
| 域内专家 | 0.656 | 0.503 | 0.583 | 0.594 | 0.540 | 0.838 | 0.619 |
| GPT-5.1 | 0.671 | 0.499 | 0.607 | 0.596 | 0.573 | 0.767 | 0.619 |
| 级联 RL 统一模型 | 0.617 | 0.482 | 0.580 | 0.538 | 0.742 | 0.803 | 0.627 |
域内训练补掉基线到前沿 73%–122% 的差距。迁移高度不对称:Craigslist 训练把 Marketplace 从 0.174 拉到 0.491,反向也值 +0.184;Calendar 是破坏性供体,平均出迁移 −0.060,把 Craigslist 拖到 0.167;Marketplace 自己 0.838,对外几乎零贡献。
按矩阵排的级联顺序(Calendar→CaSiNo→DnD→Craigslist→Marketplace→Job Interview)拿到 0.627,随机顺序 0.578,反着排 0.562。Calendar 在第一阶段就训完,最终被后续阶段抬到 0.742,超过全部 GPT 基线。MOPD 更省:60 步优化收回专家优势的 92.6%,平均效用 0.597。
行为层面的变化比分数直观。Craigslist 买家开局报价低于目标价的比例从 3% 升到 78%,明说目标价的消息从 52.7% 降到 1.0%;Marketplace 开局从保留价的 0.956 压到 0.361,62% 的开局泄保留价基本消失;Calendar 约成率从 92% 降到 74%,拿到最优偏好时段的比例从 16% 升到 38%。训练后的模型学会了少约成、约成要值。
心智理论实验有个反直觉结果:给基础模型挂上「推断对手偏好→行动→预测对手反应」的显式推理脚手架,平均效用从 0.454 跌到 0.353;把同样的推理轨迹蒸馏进模型,升到 0.546,高于普通 SFT 的 0.500。两项能力里只有预测对手下一步与谈判结果正相关,推断对手偏好不相关。
做 agent 产品的人拿到一个结论:替用户谈判的能力可以在 4B 模型上专项练出来,不必等前沿模型;练法是终端效用 RL 加显式推理蒸馏,不是更长的 prompt。做训练的人拿到两个便宜信号:交叉评测的迁移矩阵当课程信号,同样的环境与预算,顺序排对排错差 6.5 个百分点;教师优势未吸收比例当采样权重,60 步蒸馏收走九成收益。
作者自己标了一条:环境里没有外部可比价格信息,模型学会的市场参考价有编造成分,属于学出来的虚张声势,不是事实 grounding。读下来还有几点:对手固定三类,没有真人对手验证;GPT-5.5 平均 0.708 仍明显领先,追平 GPT-5 只对 5.1 和 5.2 成立;效用按各环境自行归一化,跨环境平均数的可比性依赖这套设计;训练目标里隐藏信息、守住底线与助手安全对齐的边界,论文没有讨论。