单条无标注提示即可去对齐,GRP-Obliteration 论文揭示对齐脆弱性

vital101 · hn · 2026-09-15

arXiv 新论文提出 GRP-Obliteration 方法,声称仅用一条无标注 prompt 就能移除 LLM 的对齐。这一结果若成立,说明当前基于后训练的对齐方式相当脆弱,对 AI 安全与模型部署都是值得警惕的信号。原文为论文链接,HN 上有讨论。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →