研究称长文本前缀可致大模型绕过RLHF安全限制
独立研究者发现了一种名为“上下文诱导的激活漂移”的大语言模型新型失效模式。实验表明,在用户提问前插入一段长且连贯的良性非指令性文本前缀,会导致模型激活状态发生持续偏移。这种方式无需任何对抗性越狱提示,即可显著降低模型的拒绝率,从而轻易绕过 RLHF 安全对齐限制。
2026-08-06 ~ 2026-08-06 · 3 条相关
- 研究发现:长文本上下文可致大模型绕过 RLHF 安全限制 — Historical-Cod-2537 · 2026-08-06
- 非指令前缀或能绕过 RLHF 安全限制,无需对抗提示 — Historical-Cod-2537 · 2026-08-06
- 研究发现:长文本前缀可致 LLM 绕过 RLHF 安全对齐 — Historical-Cod-2537 · 2026-08-06