研究发现:长文本前缀可致 LLM 绕过 RLHF 安全对齐

Historical-Cod-2537 · reddit · 2026-08-06

一位独立研究者在 Reddit 上分享了对大语言模型(LLM)安全机制的发现。研究表明,注入大量良性的非指令性长文本前缀会导致模型激活状态发生持续偏移(Context-Induced Activation Drift)。

这种偏移会在整个会话期间保持稳定,并使模型行为脱离 RLHF(基于人类反馈的强化学习)的安全约束。此时,模型的拒绝率下降,风格护栏消失,即使提示词中不包含明确的对抗性指令,模型也会表现出预训练分布的行为特征。

所属事件:研究称长文本前缀可致大模型绕过RLHF安全限制(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →