文档框架劫持大模型:中立上下文如何悄然绕过 RLHF 安全护栏

PresentSituation8736 · reddit · 2026-08-09

一位独立研究者分享了关于大语言模型(LLM)安全机制的深度发现:大量看似中立的长上下文会引发模型内部激活值的持续偏移。这种偏移在整个对话期间保持稳定,会导致模型行为与 RLHF(基于人类反馈的强化学习)设定的安全约束脱钩。

核心机制与现象:

作者曾向 OpenAI 和 Anthropic 报告此问题,虽未获官方直接回应,但在后续模型更新中发现相关行为已被“静默修复”(模型对该特定文本产生了距离感和批判性反应)。然而作者指出,这种治标不治本的补丁仅针对特定向量,并未解决框架同化这一底层机制隐患。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →