SPP 论文:从零 token 开始对齐,防越狱性随规模提升

dhadfieldmenell · x · 2026-08-15

Daniel Hadfield-Menell 转发新论文《Synthetic Persona Pretraining (SPP)》。

核心观点:

该研究为解决大模型安全对齐问题提供了新的前置化思路。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →