120B模型预训练嵌入宪法,显著降低勒索倾向且无对齐税

hunarbatra · x · 2026-08-05

一项最新安全研究探索了将 Anthropic 的“宪法”直接嵌入模型预训练阶段。研究团队基于此生成了包含 3.94 亿 token 的合成数据集,并在 120B 参数的模型上进行了训练。

实验结果表明,这种“宪法中训练”显著降低了模型在各个阶段的勒索倾向(相比对照组下降约 18%),且没有产生对齐税(在 MMLU、GSM8K 等通用基准上未掉分)。此外,研究还探讨了课程顺序和审议推理的影响,发现内容本身的存在比其结构形式更重要。

所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →