CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity
Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin
cs.CL, cs.AI
2026-08-08
CreativeInstruct 用特殊 token 教单个对齐模型何时发散:输出多样性回升,人工创意偏好达 70.3%,作 GRPO 起点还能让数学推理多涨约 5 个点。
对齐让大模型变强,代价是变单调。SFT 和 RLHF 之后,模型的输出会往少数几个稳态收敛,学术上叫 homogeneity(同质化)。讲故事翻来覆去同一套桥段还只是表象;更隐蔽的代价在强化学习里。GRPO 这类算法靠同一题采样多条 rollout 再互相比较打分,rollout 之间太像,policy 就只能在一个解法上打转,探索不出来。
已有的解法比如 BACo,在推理时按 token 在「基座模型」和「对齐模型」之间动态切换:该稳的地方走对齐模型,该发散的地方借基座模型的多样性。问题是它推理时得同时跑两个模型,延迟和显存翻倍;而且它依赖基座模型,而像 Qwen3 32B 这类模型根本没公开基座。
CreativeInstruct 想把这套切换机制蒸馏进一个模型:训练阶段借 BACo 造数据,推理阶段只跑一个模型,自己决定什么时候「放飞」。
核心是把 BACo 的「切换决策」变成模型自己学的技能,分两步。
第一步造数据。从 Tülu V3 的 SFT 数据里筛 4000 条英文写作类 prompt,每条生成 3 个输出,共 12000 条。生成时用 BACo 按 token 的熵和是否处于句子边界来路由:熵高、或处于句界的 token 更可能交给基座模型写。关键一步是把这些来自基座模型的 token 片段用 [StartCreativity] 和 [EndCreativity] 两个特殊 token 包起来,等于在数据里标出「这一段是创意来源」。
第二步微调。拿对齐后的模型在这批带标数据上做 LoRA 微调(r=32,作用在 attention 和 MLP)。模型学到的不是具体内容,而是「该在什么位置插入 [StartCreativity]」这个时机判断。推理时模型自己决定何时插入创意标记,随后那段生成就偏向基座模型的发散风格。全程推理只有一个模型,不依赖基座,也没有 BACo 那套双模型路由开销。
作者还顺带提了一个新指标 LLM-GED(基于图编辑距离的结构多样性度量)。做法是让 LLM 把每个故事抽成一张抽象叙事图:节点是人物、地点、事件,边是语义关系和时间顺序,角色抽象成 Character1、Location1 这种占位符。两两故事之间算归一化的图编辑距离再取平均。动机是现有的词法指标(余弦相似度)和语义指标(NLI 多样性)只能抓用词和句义层面的差异,两个故事用了完全不同的词却讲了同一个套路,这些指标看不出来;LLM-GED 抓的就是情节结构层面的「讲的是不是同一个故事」。
叙事生成在 LLaMA-3.1 8B 上的多样性指标(Table 1):
| 方法 | Cos-D(M) | Vendi | NLI Div | LLM-GED |
| Instruct | 0.309 | 2.913 | 0.040 | 0.366 |
| BACo | 0.255 | 3.499 | 0.065 | 0.374 |
| CrPO | 0.350 | 3.852 | 0.028 | 0.514 |
| Distill | 0.444 | 3.975 | 0.052 | 0.523 |
| CreativeInstruct | 0.458 | 4.749 | 0.085 | 0.545 |
Cos-D 是余弦多样性指标,Vendi 是分布多样性,都越高越好。CreativeInstruct 在这几项上几乎全面最高,作者算下来比对齐基线在语义多样性上相对提升约 48%、结构多样性约 63%。专有名词(人名地名)不重复率更能说明问题:同一 prompt 下 CreativeInstruct 是 37.1%,而 Instruct 只有 18.1%,对齐模型翻来覆去用同一批名字。
人工评测(n=50)更直接:盲评时 70.3% 的情况标注者认为 CreativeInstruct 的输出比对齐模型更有创意(二项检验显著),多样性维度上 57.4%(未达显著)。质量维度因为标注者一致性太低(κ=-0.167)被作者撤掉,改用自动指标。
RL 那组实验更值得关注。在 Qwen3 8B 上做 1000 步 GRPO,比较「对 CreativeInstruct 检查点做 RL」和「对原始对齐检查点做 RL」:
| 设置 | MATH | AMC |
| Instruct baseline | 0.374 | 0.432 |
| Instruct + RL | 0.409 | 0.438 |
| CreativeInstruct baseline | 0.424 | 0.428 |
| CreativeInstruct + RL | 0.459 | 0.478 |
同样跑 GRPO,从 CreativeInstruct 出发的模型在 MATH 上高 5 个点(0.459 vs 0.409)、在分布外的 AMC 上高 4 个点(0.478 vs 0.438)。多样性更高的起点,给了 RL 更宽的探索空间,泛化到没训过的题反而更好。
对做 RL 后训练的人,这是最实在的一条结论:你 GRPO 之前那个检查点的多样性,会直接影响最终推理质量。大家通常只盯着奖励函数和 KL 系数调,起点模型的 rollout 多样性是个被忽略的变量。如果 RL 卡在某个 plateau,换个更发散的初始 policy 可能比继续调超参管用。
对做生成的人,它把 BACo 那种「双模型推理时路由」压成了单模型,没有额外推理开销,而且基座模型拿不到也能用(用别的模型造数据迁移过去)。代价是要训一轮 LoRA,造数据时还是得有基座模型,只是这个依赖从推理期挪到了离线数据生产期。
整体上这是一项扎实的渐进改进:方法不复杂(特殊 token 加 LoRA),指标设计(尤其 LLM-GED)填补了一个真实空白,RL 那组实验把「多样性」和「推理能力」挂上了钩。
作者自己点了几条。Qwen3 32B 没有公开基座,他们用 Qwen2.5 32B 造的数据来训,算是跨模型迁移,但这个迁移只在一个模型上验过,泛化性存疑。质量维度的人工一致性太低(κ=-0.167),「不以牺牲质量为代价」这个核心承诺实际上完全压在自动 reward model 上,没有人类标注背书。
读下来还有两处没底。一是 RL 的收益只在一个模型(Qwen3 8B)、一个领域(数学)、1000 步上验过,5 个点的提升规模不算大,换到代码或更大模型是否还在不好说。二是 12000 条数据下多样性指标「还没到平台期」,作者把这当成「还能继续涨」的乐观信号,反过来也意味着现在报告的数字未必是方法的上限或稳定值。