研究发现长文本前缀可致大模型绕过RLHF安全限制

一位独立研究者在Reddit上发文揭示了大语言模型(LLM)的一种新型安全失效模式,即“上下文诱导的激活漂移”。研究发现,在提示词前注入大量良性的非指令性长文本前缀,会导致模型的激活状态发生持续偏移,进而绕过基于人类反馈的强化学习(RLHF)的安全对齐限制。这一发现暴露了当前大模型安全机制的潜在漏洞。

2026-08-06 ~ 2026-08-06 · 3 条相关