研究发现长文本前缀可致大模型绕过RLHF安全限制
一位独立研究者在Reddit上发文揭示了大语言模型(LLM)的一种新型安全失效模式,即“上下文诱导的激活漂移”。研究发现,在提示词前注入大量良性的非指令性长文本前缀,会导致模型的激活状态发生持续偏移,进而绕过基于人类反馈的强化学习(RLHF)的安全对齐限制。这一发现暴露了当前大模型安全机制的潜在漏洞。
2026-08-06 ~ 2026-08-06 · 3 条相关
- 研究发现:长文本上下文可致大模型绕过 RLHF 安全限制 — Historical-Cod-2537 · 2026-08-06
- 研究发现:长文本前缀可致 LLM 绕过 RLHF 安全对齐 — Historical-Cod-2537 · 2026-08-06
- Reddit用户发现LLM新攻击向量:非指令文本前缀可绕过RLHF — Historical-Cod-2537 · 2026-08-06