后训练模型当裁判,1.4B安全均分从76.9升到91.1

Self-Improving Pretraining: using post-trained models to pretrain better models

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

cs.CL, cs.AI, cs.LG

2026-01-29

用后训练模型改写后缀并在线打分,1.4B安全均分从76.9升到91.1,8B思考中训练后的推理均分是直接RL的3.2倍。

这篇在解决什么

常规流程先在原始文本上做 next-token 预训练,再靠后训练补安全、事实性和推理。这些行为加得太晚。写进预训练权重的统计模式,后训练不一定改得动。删掉低质或有害文档也不够:部署时模型仍会读到这类上文,却没学过如何从有害上文拐向安全、站得住的下文。

方法

预训练改成按前缀生成 128 token 的后缀。后训练模型同时改写后缀,并给候选打分。候选有三类:原文后缀、改写后缀、策略自己的 rollout。打分按质量、安全或事实性分开。有害上文保留,只把后缀改安全,模型学的是转向。更新用 online DPO,取最高分和最低分。这个损失是 off-policy,策略没采样过的原文和改写也能学。早期高分多落在原文和改写上,后期才更多落到 rollout。

安全裁判和改写器用 GRPO 从 Llama3.1-8B-Instruct 微调。安全后缀要原样保留才有满分,有害后缀改写后才给高分。事实性直接提示 GPT-OSS-120B,对照原文后缀判断幻觉程度。策略是 Llama2-1.4B。质量与事实性用 SlimPajama,约 98 万条;安全用筛过的有害 RedPajama,约 26 万条。持续预训练 2000 步,每步最多 16 条 rollout。从零训练 2.1 万步,每步只采样 1 条。

thinking mid-training 换到 Llama-3-8B,插在预训练和后训练之间。gpt-oss-120b 往 DCLM 和 FineMath 里、语义合适的位置插入思考。一半数据做 SFT,损失同时盖住原文和思考。另一半做 RL:模型先写思考再预测后文,裁判只看后文是否接近原文,用 DrGRPO 更新。随后在 DAPO-Math-14k 上做 RL 后训练,数学答案用规则核对。

结果

生成质量由 GPT-OSS-120B 对 128 token 续写两两比较,Llama Base 自对比为 50%。持续预训练主结果如下。

目标指标结果
质量标准前缀胜率 / 连贯性86.3% / 87.9%
事实性事实性均分57.6,Base 42.3,普通持续预训练 44.0
安全安全均分91.1,Base 76.9,RedPajama 普通持续预训练 75.5
三项常规基准均分质量 50.8、事实性 50.5、安全 49.1,Base 47.6

相对 Llama Base,事实性高 36.2%,安全高 18.5%。常规基准大约只动 1 到 3 分。

对单条 rollout 做 SFT 会塌:安全分 99.5,标准前缀胜率 2.0,常规基准 29.5,输出变成无意义但看着安全的符号串。只 SFT 改写,安全分 86.5,胜率仍在 52.7(标准前缀)和 50.6(有害前缀)。原文对 16 条 rollout 的 online DPO 同时拿到标准前缀胜率 73.6、有害前缀胜率 77.7、安全分 91.1。rollout 从 1 增到 16,三项都在涨。8 条 rollout 下,微调 8B 裁判的质量胜率 72.1,GPT-OSS-120B 为 84.3。

从零、每步 1 条 rollout 时,对照 Llama Base 的标准前缀胜率,RF-NLL 为 32.4,同样从零的 next-token 只有 1.3,安全均分 97.5 对 85.2。32.4 仍低于 50,还没追上训完的 Llama Base。

思考中训练的终点是后训练后的 pass@1 均分(每题 16 次采样取平均),覆盖 GSM8K、MATH-500、Olympiad、AMC23、GPQA-Diamond。

流程中训练 token均分
基座直接 RL00.1197
原始文本 SFT 再 RL10.5B0.1645
思考 SFT 再 RL10.5B0.3480
思考 SFT 加 RL 中训练再 RL11B0.3837

0.3837 约为直接 RL 的 3.2 倍,也高于原始文本中训练的 0.1645。全流程 GSM8K 0.7934,直接 RL 为 0.2172;MATH-500 0.4612 对 0.1038;Olympiad 0.1593 对 0.0211;GPQA-Diamond 只从 0.2314 到 0.3220。后训练前,思考 SFT 加 RL 中训练已到 0.3390,基座 0.0475,原始 SFT 0.0999。思考 SFT 从 7.8B token 加到 10.5B,后训练均分只从 0.3346 到 0.3480;8.7B 且含 RL 中训练则到 0.3785。Qwen3-8B-Base 上,原始文本 SFT 把均分从 0.3572 拉到 0.2802,RL 中训练再拉回 0.3660。

为什么重要

改写和 LLM-as-judge 被提前到预训练。有害上文留着,下文被扳正,学的是在坏上下文里转向。思考中训练把「先想再续写」放进网页文本,后训练不用从零教推理这套格式。

手里已经有强后训练模型时,可以用它重做更小模型的早期监督。论文称,安全和质量优化后的 1.4B 超过 Llama-3.1-8B Base。每步要采样并调用裁判,比 next-token 慢。实验停在百万级样本、约 11B 中训练 token。

局限与存疑

实验不是闭环自我改进。教师是 Llama3.1-8B-Instruct 和 GPT-OSS-120B,学生是 Llama2-1.4B 或 Llama-3-8B,没有用学生再训练下一代。

评测端的生成质量、安全和事实性都由 GPT-OSS-120B 打分。质量与事实性的训练裁判也是它,安全训练裁判是微调过的 8B。常规知识基准几乎不动,增益和裁判偏好绑在一起。事实性裁判把原文后缀当地面真值,网页原文可以是错的。安全与事实性互不迁移,三个目标合在同一次训练里没有完整做完。安全变成默认行为后,需要写出不安全文本的场景会受损;论文提到的 control token 没有进主实验。

思考的奖励只看预测后文是否接近原文。思考变长和奖励一起上升,长度投机没有被拆开。3.2 倍主要来自数学题,GPQA 涨幅小,后训练也只有 DAPO-Math。Llama-3-8B 基座 GSM8K 仅 0.0123,倍数从很低的地板算起。Qwen3 上几乎没有增益。两条线没有接成同一条流水线。

术语

原文与代码

社区讨论

相关论文

全部论文解读