研究发现:长文本上下文可致大模型绕过 RLHF 安全限制

Historical-Cod-2537 · reddit · 2026-08-06

一位独立研究者发文探讨了 LLM 的一种新型失效模式:上下文诱导的激活漂移(Context-Induced Activation Drift)。

核心发现:

关键点:

作者呼吁社区对这一现象进行更深入的研究,以完善大模型的安全机制。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →