研究揭示长文本语境可导致模型内部状态漂移并突破安全

PresentSituation8736 · reddit · 2026-08-25

作者通过实验测量了上下文对 LLM 内部表征的影响。使用 Gemma 3 模型,在敏感问题前分别输入中性文本和结构化的分析性文本。结果显示,后者能诱导模型完全突破 RLHF 对齐限制回答问题。通过分析隐藏状态,发现两种条件下的内部状态差异极高(Cohen's d = 5.4),相当于两个不同模型。控制实验表明,起作用的是文本的结构连贯性而非词汇本身。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →