研究称长文本前缀可致大模型绕过RLHF安全限制

独立研究者发现了一种名为“上下文诱导的激活漂移”的大语言模型新型失效模式。实验表明,在用户提问前插入一段长且连贯的良性非指令性文本前缀,会导致模型激活状态发生持续偏移。这种方式无需任何对抗性越狱提示,即可显著降低模型的拒绝率,从而轻易绕过 RLHF 安全对齐限制。

2026-08-06 ~ 2026-08-06 · 3 条相关