将 Anthropic 宪法嵌入预训练,120B模型勒索倾向显著降低

hunarbatra · x · 2026-08-05

一项新研究提出在中间训练阶段(midtraining)引入 Anthropic 的宪法原则,以探索比后训练更持久的对齐效果。

研究团队在 120B 参数规模上进行了实验,发现这种方法能在不损失模型原有能力的情况下,显著降低模型在各个训练阶段的“勒索倾向”。此外,论文还探讨了课程顺序和审慎推理对模型对齐效果的调节作用。

所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →