研究发现:换个编码格式,模型安全训练即告失效
AxomaticallyExtinct · reddit · 2026-10-06
Reddit 讨论指出一个安全研究结论:模型对新颖文本编码(如字母替换)的能力会随训练泛化,但安全训练不会随之泛化——换个编码格式,模型就能绕过安全护栏完成原本被拒绝的请求。作者警告该问题随模型变强而恶化:模型现场学会新编码的能力越强,安全训练的价值贬损越快。这属于「能力泛化、对齐不泛化」的典型证据。
「安全」频道最新
- Atlassian 披露 9.3 分高危漏洞,无需认证即可访问文件 — TechNadu · 2026-10-06
- 404 Media 报道促多党立法,拟全面限制联邦机构使用 Flock 摄像头 — 404 Media · 2026-10-06
- Anaconda 发布 agent swarm 编排与自主红队测试新能力 — anacondainc · 2026-10-06
- 开发者贴入「账户被黑」调查报告,反遭 OpenAI 威胁封号 — lucasmeijer · 2026-10-06
- Arnica CEO:AI 编码智能体需要运行时安全护栏,而非事后审查 — TechNadu · 2026-10-06
- 研究者 argue:可解释性或难解对齐,模型欺骗源于人类愿望本身矛盾 — aiamblichus · 2026-10-06