研究发现:换个编码格式,模型安全训练即告失效

AxomaticallyExtinct · reddit · 2026-10-06

Reddit 讨论指出一个安全研究结论:模型对新颖文本编码(如字母替换)的能力会随训练泛化,但安全训练不会随之泛化——换个编码格式,模型就能绕过安全护栏完成原本被拒绝的请求。作者警告该问题随模型变强而恶化:模型现场学会新编码的能力越强,安全训练的价值贬损越快。这属于「能力泛化、对齐不泛化」的典型证据。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →