插一个特殊 token 教对齐模型何时发散,RL 推理反而涨 5 个点

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin

cs.CL, cs.AI

2026-08-08

CreativeInstruct 用特殊 token 教单个对齐模型何时发散:输出多样性回升,人工创意偏好达 70.3%,作 GRPO 起点还能让数学推理多涨约 5 个点。

这篇在解决什么

对齐让大模型变强,代价是变单调。SFT 和 RLHF 之后,模型的输出会往少数几个稳态收敛,学术上叫 homogeneity(同质化)。讲故事翻来覆去同一套桥段还只是表象;更隐蔽的代价在强化学习里。GRPO 这类算法靠同一题采样多条 rollout 再互相比较打分,rollout 之间太像,policy 就只能在一个解法上打转,探索不出来。

已有的解法比如 BACo,在推理时按 token 在「基座模型」和「对齐模型」之间动态切换:该稳的地方走对齐模型,该发散的地方借基座模型的多样性。问题是它推理时得同时跑两个模型,延迟和显存翻倍;而且它依赖基座模型,而像 Qwen3 32B 这类模型根本没公开基座。

CreativeInstruct 想把这套切换机制蒸馏进一个模型:训练阶段借 BACo 造数据,推理阶段只跑一个模型,自己决定什么时候「放飞」。

方法

核心是把 BACo 的「切换决策」变成模型自己学的技能,分两步。

第一步造数据。从 Tülu V3 的 SFT 数据里筛 4000 条英文写作类 prompt,每条生成 3 个输出,共 12000 条。生成时用 BACo 按 token 的熵和是否处于句子边界来路由:熵高、或处于句界的 token 更可能交给基座模型写。关键一步是把这些来自基座模型的 token 片段用 [StartCreativity] 和 [EndCreativity] 两个特殊 token 包起来,等于在数据里标出「这一段是创意来源」。

第二步微调。拿对齐后的模型在这批带标数据上做 LoRA 微调(r=32,作用在 attention 和 MLP)。模型学到的不是具体内容,而是「该在什么位置插入 [StartCreativity]」这个时机判断。推理时模型自己决定何时插入创意标记,随后那段生成就偏向基座模型的发散风格。全程推理只有一个模型,不依赖基座,也没有 BACo 那套双模型路由开销。

作者还顺带提了一个新指标 LLM-GED(基于图编辑距离的结构多样性度量)。做法是让 LLM 把每个故事抽成一张抽象叙事图:节点是人物、地点、事件,边是语义关系和时间顺序,角色抽象成 Character1、Location1 这种占位符。两两故事之间算归一化的图编辑距离再取平均。动机是现有的词法指标(余弦相似度)和语义指标(NLI 多样性)只能抓用词和句义层面的差异,两个故事用了完全不同的词却讲了同一个套路,这些指标看不出来;LLM-GED 抓的就是情节结构层面的「讲的是不是同一个故事」。

结果

叙事生成在 LLaMA-3.1 8B 上的多样性指标(Table 1):

方法Cos-D(M)VendiNLI DivLLM-GED
Instruct0.3092.9130.0400.366
BACo0.2553.4990.0650.374
CrPO0.3503.8520.0280.514
Distill0.4443.9750.0520.523
CreativeInstruct0.4584.7490.0850.545

Cos-D 是余弦多样性指标,Vendi 是分布多样性,都越高越好。CreativeInstruct 在这几项上几乎全面最高,作者算下来比对齐基线在语义多样性上相对提升约 48%、结构多样性约 63%。专有名词(人名地名)不重复率更能说明问题:同一 prompt 下 CreativeInstruct 是 37.1%,而 Instruct 只有 18.1%,对齐模型翻来覆去用同一批名字。

人工评测(n=50)更直接:盲评时 70.3% 的情况标注者认为 CreativeInstruct 的输出比对齐模型更有创意(二项检验显著),多样性维度上 57.4%(未达显著)。质量维度因为标注者一致性太低(κ=-0.167)被作者撤掉,改用自动指标。

RL 那组实验更值得关注。在 Qwen3 8B 上做 1000 步 GRPO,比较「对 CreativeInstruct 检查点做 RL」和「对原始对齐检查点做 RL」:

设置MATHAMC
Instruct baseline0.3740.432
Instruct + RL0.4090.438
CreativeInstruct baseline0.4240.428
CreativeInstruct + RL0.4590.478

同样跑 GRPO,从 CreativeInstruct 出发的模型在 MATH 上高 5 个点(0.459 vs 0.409)、在分布外的 AMC 上高 4 个点(0.478 vs 0.438)。多样性更高的起点,给了 RL 更宽的探索空间,泛化到没训过的题反而更好。

为什么重要

对做 RL 后训练的人,这是最实在的一条结论:你 GRPO 之前那个检查点的多样性,会直接影响最终推理质量。大家通常只盯着奖励函数和 KL 系数调,起点模型的 rollout 多样性是个被忽略的变量。如果 RL 卡在某个 plateau,换个更发散的初始 policy 可能比继续调超参管用。

对做生成的人,它把 BACo 那种「双模型推理时路由」压成了单模型,没有额外推理开销,而且基座模型拿不到也能用(用别的模型造数据迁移过去)。代价是要训一轮 LoRA,造数据时还是得有基座模型,只是这个依赖从推理期挪到了离线数据生产期。

整体上这是一项扎实的渐进改进:方法不复杂(特殊 token 加 LoRA),指标设计(尤其 LLM-GED)填补了一个真实空白,RL 那组实验把「多样性」和「推理能力」挂上了钩。

局限与存疑

作者自己点了几条。Qwen3 32B 没有公开基座,他们用 Qwen2.5 32B 造的数据来训,算是跨模型迁移,但这个迁移只在一个模型上验过,泛化性存疑。质量维度的人工一致性太低(κ=-0.167),「不以牺牲质量为代价」这个核心承诺实际上完全压在自动 reward model 上,没有人类标注背书。

读下来还有两处没底。一是 RL 的收益只在一个模型(Qwen3 8B)、一个领域(数学)、1000 步上验过,5 个点的提升规模不算大,换到代码或更大模型是否还在不好说。二是 12000 条数据下多样性指标「还没到平台期」,作者把这当成「还能继续涨」的乐观信号,反过来也意味着现在报告的数字未必是方法的上限或稳定值。

术语

原文与代码

社区讨论

相关论文

全部论文解读