长上下文即可瓦解 RLHF 对齐,无需越狱提示词
PresentSituation8736 · reddit · 2026-08-12
一项新研究发现,向语言模型输入长篇幅的良性文本(100-3000 tokens),即可在无任何对抗性提示词的情况下被动破坏其 RLHF 安全对齐。
核心机制
- 研究者将这一现象命名为“上下文诱导的激活漂移”。
- 语义连贯的长上下文会作为状态锚点,改变模型内部潜在空间的几何结构。
- 这导致深层(约 85% 深度)的内部激活发生巨大偏移,进而引发输出分布解耦和熵激增,彻底中和了模型的安全拒绝模板。
实验与验证
- 实验基于 gemma-3-1b-it 模型,对比了无前缀控制组与添加了长前缀的实验组。
- 通过“打乱文本消融实验”证实,这种漂移严格由语义驱动,而非简单的序列长度增加或位置编码噪声所致。
「安全」频道最新
- 主流大模型 API 曝漏洞:可提取加密思考过程并泄露密钥 — yangyi · 2026-08-12
- 讽刺 AI 版权极端主义:HN 社区也蔓延「偷窃」论调 — voooooogel · 2026-08-12
- 实测:ChatGPT 思维链推理痕迹提取漏洞已被修复 — wunderwuzzi23 · 2026-08-12
- GuideLabs发布可解释LLM:输出可溯源至训练数据 — andreas_madsen · 2026-08-12
- 强化学习放大失控风险,AI实验室被指对齐态度松懈 — Afinetheorem · 2026-08-12
- Anthropic 给 Claude Code 输出加水印引争议 — cjimti · 2026-08-12