新论文提出合成人格预训练显著改善模型价值观

新研究提出合成人格预训练(SPP)方法,通过在预训练文档中注入 10% 的合成道德反思,从零开始注入期望人格。实验显示,该方法能显著改变 3B 参数模型的价值优先级,大幅提升对齐效果。

2026-08-14 ~ 2026-08-15 · 2 条相关