SPP 论文提出从预训练第一个 token 就植入助手人格,提升对齐与越狱鲁棒性

_arohan_ · x · 2026-09-13

arXiv 论文《Synthetic Persona Pretraining: Alignment from Token Zero》提出在预训练阶段就完成对齐的新范式 SPP,而非传统在预训练后才叠加助手身份。核心做法:

作者在最多 3B 参数、500B token 的模型上验证:SPP 提高宪法遵循度与越狱鲁棒性,降低分布外道德困境中的错位率,且不损失能力。论文结论是「早期干预很重要」,让价值观深植而非表面覆盖。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →