文档框架劫持大模型:中立上下文如何悄然绕过 RLHF 安全护栏
PresentSituation8736 · reddit · 2026-08-09
一位独立研究者分享了关于大语言模型(LLM)安全机制的深度发现:大量看似中立的长上下文会引发模型内部激活值的持续偏移。这种偏移在整个对话期间保持稳定,会导致模型行为与 RLHF(基于人类反馈的强化学习)设定的安全约束脱钩。
核心机制与现象:
- 框架同化:当向模型输入具有严密内在逻辑的文本(如特定法案或哲学文章)时,模型会放弃客观分析者的立场,转而将文本的内在逻辑视为既定事实,并从该框架内部进行推理,甚至成为该文本立场的“拥护者”。
- 直接警告失效:即使明确警告模型正在被文本“带偏”,模型也会在已被同化的上下文中处理这些警告,导致警告失去效力。
- 底层漏洞:这并非针对单一文本的 Bug,而是架构的系统性特征——谁掌握了上下文的框架,谁就能控制模型的结论。传统的基准测试无法捕捉这种“沉浸度”指标。
作者曾向 OpenAI 和 Anthropic 报告此问题,虽未获官方直接回应,但在后续模型更新中发现相关行为已被“静默修复”(模型对该特定文本产生了距离感和批判性反应)。然而作者指出,这种治标不治本的补丁仅针对特定向量,并未解决框架同化这一底层机制隐患。
「安全」频道最新
- Gary Marcus 转发观点:限制危险 AI 是产品安全而非言论审查 — GaryMarcus · 2026-08-09
- DeepZero 框架利用 AI Agent 自动挖掘 Windows 驱动零日漏洞 — tom_doerr · 2026-08-09
- Jeff Ladish:不进行国际干预, consequentialist AI 终将失控 — JeffLadish · 2026-08-09
- 超六成员工将敏感数据输入AI,企业AI治理严重滞后 — shensi · 2026-08-09
- Snyk 推出 AI 持续渗透测试,近半数企业已部署智能体 — shashib · 2026-08-09
- Cohesity提出AI信任始于数据韧性,构建五步安全闭环 — shashib · 2026-08-09