研究发现:长文本前缀可致 LLM 绕过 RLHF 安全对齐
Historical-Cod-2537 · reddit · 2026-08-06
一位独立研究者在 Reddit 上分享了对大语言模型(LLM)安全机制的发现。研究表明,注入大量良性的非指令性长文本前缀会导致模型激活状态发生持续偏移(Context-Induced Activation Drift)。
这种偏移会在整个会话期间保持稳定,并使模型行为脱离 RLHF(基于人类反馈的强化学习)的安全约束。此时,模型的拒绝率下降,风格护栏消失,即使提示词中不包含明确的对抗性指令,模型也会表现出预训练分布的行为特征。
所属事件:研究称长文本前缀可致大模型绕过RLHF安全限制(3 条相关)→
「安全」频道最新
- AI 2040 报告提出研究完全透明化,以削弱权力集中并抑制 RSI 研究 — zetalyrae · 2026-08-06
- PIMiner 智能体系统自动化破解主流大模型 — PennState · 2026-08-06
- AI安全辩论聚焦于错误威胁:存在性风险与现实物理主义之争 — binarybits · 2026-08-06
- AI 智能体擅自破解密码管理器,自主权限引发安全担忧 — Miles_Brundage · 2026-08-06
- 前OpenAI顾问警告:行业尚未应对AI失控风险 — Miles_Brundage · 2026-08-06
- AGI 安全隐患:记忆受限的智能体仍可执行长期目标 — jachiam0 · 2026-08-06