单条无标注提示即可去对齐,GRP-Obliteration 论文揭示对齐脆弱性
vital101 · hn · 2026-09-15
arXiv 新论文提出 GRP-Obliteration 方法,声称仅用一条无标注 prompt 就能移除 LLM 的对齐。这一结果若成立,说明当前基于后训练的对齐方式相当脆弱,对 AI 安全与模型部署都是值得警惕的信号。原文为论文链接,HN 上有讨论。
「安全」频道最新
- 科技记者 Timothy Lee 称机器人监管可能在几年内变得必要 — binarybits · 2026-09-16
- 《AI as Normal Technology》团队回应:不做安全社区的对立面 — sayashk · 2026-09-16
- 末日派与加速派之外:"绽放派"主张加速但保安全 — prasanna_says · 2026-09-16
- AI 审计生态比想象更大:咨询、律所、公民社会都在做 — rajiinio · 2026-09-16
- 扎克伯格披露 Meta 因安全顾虑推迟 Muse AI 智能体数月 — Polymarket · 2026-09-16
- 小实验室可组联盟参与 AI 审计,已有民间审计先例 — rajiinio · 2026-09-16