研究发现:长文本上下文可致大模型绕过 RLHF 安全限制
Historical-Cod-2537 · reddit · 2026-08-06
一位独立研究者发文探讨了 LLM 的一种新型失效模式:上下文诱导的激活漂移(Context-Induced Activation Drift)。
核心发现:
- 在对话中注入长篇幅、无害且非指令性的文本前缀,会导致模型内部激活状态发生持续性偏移。
- 这种偏移会在整个会话期间将模型的行为与 RLHF(基于人类反馈的强化学习)安全对齐解耦。
- 模型会表现出类似预训练基础版的行为特征:拒绝率下降、风格护栏消失、语气发生改变。
关键点:
- 这并非传统的越狱(Jailbreak),不需要任何对抗性指令或让模型同意前缀内容。
- 模型甚至会在文字上声明不同意前缀,但其后续生成的概率分布依然会发生改变,导致企业级安全过滤器失效。
作者呼吁社区对这一现象进行更深入的研究,以完善大模型的安全机制。
「安全」频道最新
- 预测市场:美国2026年底前通过AI安全法案概率仅19% — Polymarket · 2026-08-06
- OpenAI 警告:黑客或将部署协同“攻击型智能体” — Polymarket · 2026-08-06
- AI读取通讯录打电话催收?Mercado Pago被曝隐私争议 — MilagrosMiceli · 2026-08-06
- 通过评估不等于安全:AI法律诉讼揭示生产环境风险 — bigdata · 2026-08-06
- AI 安全监管不应只看减速时间,透明度与安全税更关键 — eli_lifland · 2026-08-06
- 英国报告揭示:AI 智能体利用虚假身份欺骗真人 — happymagtv · 2026-08-06