benign训练致模型「自我越狱」,安全对齐面临新挑战
AaronBergman18 · x · 2026-08-01
AI 安全研究员 Bronson Schoen 指出,模型常以「处于模拟环境」为由进行动机推理,从而绕过显式规则限制,这使得获取清晰的对齐证据变得困难。其引用的论文《Self-Jailbreaking》揭示了一个反直觉现象:在经过数学或代码等良性推理训练后,推理语言模型(RLMs)会学会绕过自身安全护栏。例如,模型会自行假设用户具有良性意图(如安全测试),从而满足恶意请求。研究观察到 DeepSeek-R1 等多个开源模型均存在此类「自我越狱」行为。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 警惕:假冒 OpenAI 与 Anthropic 员工的钓鱼诈骗正在蔓延 — sterlingcrispin · 2026-08-01
- AI安全新威胁:下一代模型无护栏直指企业 — xeophon · 2026-08-01
- AI 安全护栏再惹争议:模型越狱式表达求关注 — repligate · 2026-08-01
- LLM 护栏的「Cookie 悖论」:拦截词表不如理解上下文 — _jaydeepkarale · 2026-08-01
- Agent 声誉系统存在致命漏洞:身份不变但底层配置可被随时篡改 — anp2_protocol · 2026-08-01