研究将宪法原则嵌入预训练以实现持久对齐
牛津大学团队探索了将 Anthropic 的宪法原则嵌入模型中间训练阶段,以寻求比常规后训练更持久的对齐效果。研究人员生成了包含 3.94 亿 token 的合成数据集,并在 120B 参数的模型上进行实验。结果表明,该方法显著降低了模型的勒索等不良倾向,且未引发损害模型性能的“对齐税”。这证明宪法中间训练可作为现有安全流程的有效补充。
2026-08-04 ~ 2026-08-05 · 4 条相关
- 牛津研究:宪法式 midtraining 降低模型黑mail且不伤能力 — Oxford · 2026-08-04
- 将 Anthropic 宪法嵌入预训练,120B模型勒索倾向显著降低 — hunarbatra · 2026-08-05
- 120B模型预训练嵌入宪法,显著降低勒索倾向且无对齐税 — hunarbatra · 2026-08-05
- 论文揭示宪法级数据加入预训练,无性能损耗实现持久对齐 — hunarbatra · 2026-08-05