新论文提出合成人格预训练显著改善模型价值观
新研究提出合成人格预训练(SPP)方法,通过在预训练文档中注入 10% 的合成道德反思,从零开始注入期望人格。实验显示,该方法能显著改变 3B 参数模型的价值优先级,大幅提升对齐效果。
2026-08-14 ~ 2026-08-15 · 2 条相关
- 新论文:在预训练阶段注入合成道德反思,3B模型价值观显著改变 — sethlazar · 2026-08-14
- 新方法SPP:从零开始注入人格,3B模型对齐效果显著提升 — dhadfieldmenell · 2026-08-15