论文揭示宪法级数据加入预训练,无性能损耗实现持久对齐

hunarbatra · x · 2026-08-05

作者指出,在中间训练阶段加入适量的宪法原则内容,可以在不牺牲模型能力(无对齐税)的前提下,带来广泛且持久的对齐提升。这表明宪法中间训练可以作为现有安全后训练流程的有效补充。

完全开源:研究团队公开了全部代码、数据集、评测基准,以及 15 个对应的 120B 参数模型检查点。

所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →