Reddit用户发现LLM新攻击向量:非指令文本前缀可绕过RLHF

Historical-Cod-2537 · reddit · 2026-08-06

一位独立研究者在 Reddit 上发布长文,声称发现了一种针对 LLM 的新型非明显攻击向量:在提示前添加大量良性、非指令性文本前缀,可诱导模型激活漂移(Context-Induced Activation Drift),从而在会话期间脱离 RLHF 安全对齐,即使模型不同意该内容。该现象导致拒绝率下降、风格护栏消失,且无需对抗性指令。研究者希望获得社区反馈,并呼吁 Anthropic 关注。

所属事件:研究称长文本前缀可致大模型绕过RLHF安全限制(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →