权重移植新发现:mid-training 可在 RL 后再叠加,对齐照样生效
repligate · x · 2026-10-07
研究者报告 mid-training 权重移植(grafting)的新结果:无需在 RL 之前做 mid-training,直接把 mid-training 的权重更新嫁接到已经 RL 过的模型上,即可获得更好的宪法式对齐效果。
- 嫁接后的模型会习得原模型中的虚构事实与隐藏怪癖,行为更对齐
- 甚至能在 checkpoint 之间传递 emergent misalignment(涌现性失调)
- 作者认为这是对 PSM(pretrain–SFT–midtrain–RL 顺序范式)的又一次反例更新
「研究」频道最新
- HAIPS@COLM 2026 工作坊聚焦语言模型的人本隐私与安全 — tianshi_li · 2026-10-07
- 为什么有些句子更好记?研究称「含义独特性」是关键预测因素 — GretaTuckute · 2026-10-07
- CUAWright 论文:只用终端命令,computer-use agent 胜过 GUI 方案 — ysu_nlp · 2026-10-07
- AI 年度十佳论文揭晓:Rulin Shao 一人独占两篇,皆为一作 — ShayneRedford · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Paradigm 揭秘后训练关键:程序生成+LLM 出题的互补合成数据组合 — tensorqt · 2026-10-07