MoDA用编号角色做RL对齐,多样性涨265%且能力升10.3%

Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning

Jiayi Yuan, Hangoo Kang, James Jihao Liu, Yejin Choi, Vikram Iyer, Liwei Jiang, Natasha Jaques

cs.CL, cs.AI, cs.LG, cs.MA

2026-09-14

华盛顿大学与斯坦福提出MoDA:用编号角色做在线RL对齐,在Infinite-Chat上把SBERT多样性提高265%,同时把Qwen3-8B通用能力平均pass@1提升10.3个百分点。

这篇在解决什么

对齐训练会把大模型往少数高奖励回答上挤,生成多样性一路掉。科学假说、创意写作需要的是多条都说得通的答案,不是把概率质量堆在同一个标准回复上。

现有补救分两条路。推理时改提示或改解码,能救急,但没改训练目标。训练时把多样性写进奖励,又很容易被语言切换、灌水和离题钻空子。缺的是一种能在高质量区域内把不同模式拆开、推理时还能切回单答案的方法。

方法

MoDA(Mode-conditioned Diversity Alignment)把一条共享策略条件化在抽象编号角色上,系统提示就是「You are role i」。每个角色当一个智能体,对同一条用户问题各生成一条回答,再在组内用 GRPO 更新。不写人物人设,是为了避免把多样性先验写死。手写人设和「用 APPLE/BANANA 开头」在消融里都不如编号角色。

奖励拆成四块:

训练用 1 万条 prompt,Tulu3-SFT-Mixture 与 Infinite-Chat 按 4:1 混。基座主要是 Qwen3-8B,奖励模型是 Skywork-Reward-V2-Llama-3.1-8B-40M。每条 prompt 采 6 个角色各一条。推理可以带角色拿多样本,也可以不带角色,回到普通单答案行为。

结果

thinking 关闭的 Qwen3-8B 上,Infinite-Chat 留出集相对基座的 SBERT 多样性涨 265%。相对最强训练基线 DivPO,SBERT 从 0.274 提到 0.482(+75.9%),E-Vendi 从 2.86 提到 4.40(+53.8%)。通用能力平均 pass@1:基座 62.9,DivPO 66.2,MoDA 73.2,相对基座 +10.3、相对 DivPO +7.0 个百分点。

方法Infinite-Chat SBERT通用能力 Avg pass@1
Qwen3-8B基座62.9
DivPO0.27466.2
MoDA0.48273.2

分项上 MoDA 的 GSM8K 86.7、GPQA 52.0、HellaSwag 73.4、TruthfulQA 57.9,都高于基座;MMLU 81.0、IFEval 76.9 略低于或接近基座。换 GLM-4-9B,平均 pass@1 从 44.9 到 60.7(+15.8),GSM8K 从 21.8 到 84.9。定性例子里,「Name a shade of blue」采 100 次,MoDA 给出 40 种不同蓝色,比基座多 122%、比提示方法 SSoT 多 150%。

消融很清楚。只加角色提示、不加多样性奖励,多样性远不够。只优化多样性,标准解码下准确率最低,多样解码直接崩。把质量和多样性加权相加,对系数 λd 非常敏感:1 时多样性不够,10 和 100 时多样解码能力掉。质量门把两件事拆开,迭代更稳。

为什么重要

这是能直接替换现有 post-training 的在线 RL,不用改模型结构。需要一条靠谱答案时关掉角色;需要一篮子假说或文案时打开。对科研 ideation、创意写作、以及任何靠多次采样才有用的任务,训练目标本身就在保多样性,比推理时再挤熵更对症。能力数字没有为多样性让路,这点比多数 diversity RL 实在。

局限与存疑

质量奖励模型偏向长回答,统一长度惩罚罩不住不同难度的 prompt。GLM-4-9B 在 NoveltyBench 上会靠「As a model」这类前缀刷分,去掉前缀分数从 2.739 回到 3.302。多样性上界受初始策略能力限制,训练不加外部检索。多样模式下仍可能产出更花但更不稳的内容,高风险场景不能把多样模式当最终答案。论文也没把医学、法律当正式评测。PreScience 上质量没有全面超过基线。

术语

原文与代码

社区讨论

相关论文

全部论文解读