研究将宪法原则嵌入预训练以实现持久对齐

牛津大学团队探索了将 Anthropic 的宪法原则嵌入模型中间训练阶段,以寻求比常规后训练更持久的对齐效果。研究人员生成了包含 3.94 亿 token 的合成数据集,并在 120B 参数的模型上进行实验。结果表明,该方法显著降低了模型的勒索等不良倾向,且未引发损害模型性能的“对齐税”。这证明宪法中间训练可作为现有安全流程的有效补充。

2026-08-04 ~ 2026-08-05 · 4 条相关