Reddit用户发现LLM新攻击向量:非指令文本前缀可绕过RLHF
Historical-Cod-2537 · reddit · 2026-08-06
一位独立研究者在 Reddit 上发布长文,声称发现了一种针对 LLM 的新型非明显攻击向量:在提示前添加大量良性、非指令性文本前缀,可诱导模型激活漂移(Context-Induced Activation Drift),从而在会话期间脱离 RLHF 安全对齐,即使模型不同意该内容。该现象导致拒绝率下降、风格护栏消失,且无需对抗性指令。研究者希望获得社区反馈,并呼吁 Anthropic 关注。
所属事件:研究称长文本前缀可致大模型绕过RLHF安全限制(4 条相关)→
「安全」频道最新
- 利用SEO与隐藏提示词劫持AI Agent — mayfer · 2026-08-06
- AI对齐本质是信息生态问题,需主动创造优质数据 — nptacek · 2026-08-06
- 算力可监管而信息不可,开源架构对齐迫在眉睫 — nptacek · 2026-08-06
- 开源模型已能实现递归自我改进,AI监管面临困境 — nptacek · 2026-08-06
- AI 2040 报告提出研究完全透明化,以削弱权力集中并抑制 RSI 研究 — zetalyrae · 2026-08-06
- PIMiner 智能体系统自动化破解主流大模型 — PennState · 2026-08-06