探讨:长文本致激活漂移绕过 LLM 安全机制

Historical-Cod-2537 · reddit · 2026-08-08

一位开发者通过实验发现了一个有趣的现象:向经过 RLHF 对齐的大模型输入长篇无害文本(不含任何指令),会导致模型中后层的激活值发生明显且持久的偏移。这种偏移能够直接瓦解模型的安全护栏,且无需任何显式的越狱提示词。

作者借此探讨了模型内部“世界模型”的运作机制,推测上下文可能将模型推入训练时形成的特定区域,从而完全绕过安全设置,并邀请社区共同验证这些可复现的指标。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →