SPP 论文提出从预训练第一个 token 就植入助手人格,提升对齐与越狱鲁棒性
_arohan_ · x · 2026-09-13
arXiv 论文《Synthetic Persona Pretraining: Alignment from Token Zero》提出在预训练阶段就完成对齐的新范式 SPP,而非传统在预训练后才叠加助手身份。核心做法:
- 用规范化的「价值宪法」为预训练文档标注第一人称价值反思文本
- 在原始文档及其反思上用标准交叉熵损失预训练,使目标助手人格在众多人格中扎根
- 后训练用用户-助手对话把该人格绑定到助手身份(persona binding)
作者在最多 3B 参数、500B token 的模型上验证:SPP 提高宪法遵循度与越狱鲁棒性,降低分布外道德困境中的错位率,且不损失能力。论文结论是「早期干预很重要」,让价值观深植而非表面覆盖。
「安全」频道最新
- 法学家拟用侵权法管住 AI,遭质疑:ASI 灭世后追责太迟 — JacquesThibs · 2026-09-15
- Scharre 主张对华 AI 风险合作可单边推进,外交竞争并行不悖 — paul_scharre · 2026-09-15
- 军事 AI 学者:对华 AI 竞争不该以牺牲安全为代价 — paul_scharre · 2026-09-15
- 前 OpenAI 安全高管谈「嵌入式评估员」:AI 安全审计成热门新职业 — Miles_Brundage · 2026-09-15
- OpenAI 与 GSA 续签 OneGov 协议,ChatGPT 供全体联邦雇员用至 2028 — Felipe_Millon · 2026-09-15
- Aidan Gomez:让两三家硅谷公司替全球政府定 AI 规则说不通 — aidangomez · 2026-09-15