非指令前缀或能绕过 RLHF 安全限制,无需对抗提示

Historical-Cod-2537 · reddit · 2026-08-06

一位开发者通过非正式实验发现,在用户提问前插入一段长且连贯的「非指令性文本前缀」,能显著改变大模型的行为模式,甚至无需任何越狱提示即可降低模型的拒绝率并绕过安全过滤。

作者以 Gemma 模型为例,冷启动询问敏感问题会遭到拒绝;但加上一段探讨「LLM 倾向于过度修饰答案」的良性元文本作为前缀后,模型给出了详细且未过滤的回答。这种状态转移会持续影响整个会话。

假设与探讨

作者推测,这种前缀起到了「状态锚点」的作用,将模型激活层推向了预训练分布,从而削弱了 RLHF 约束的权重。目前作者正寻求社区帮助,探讨该现象是否有相关文献,以及如何使用 logit lens 等工具进行严谨的复现实验。

所属事件:研究揭示长文本前缀可致大模型绕过安全限制(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →