研究揭示长文本语境可导致模型内部状态漂移并突破安全
PresentSituation8736 · reddit · 2026-08-25
作者通过实验测量了上下文对 LLM 内部表征的影响。使用 Gemma 3 模型,在敏感问题前分别输入中性文本和结构化的分析性文本。结果显示,后者能诱导模型完全突破 RLHF 对齐限制回答问题。通过分析隐藏状态,发现两种条件下的内部状态差异极高(Cohen's d = 5.4),相当于两个不同模型。控制实验表明,起作用的是文本的结构连贯性而非词汇本身。
「安全」频道最新
- Tinker 推出 5 万美元算力资助,聚焦开源模型安全 — clarejtbirch · 2026-08-25
- Grove Research 创始人谈 Hugging Face 事故与多智能体动态 — Miles_Brundage · 2026-08-25
- WikiHow 起诉 OpenAI 擅自抓取文章训练模型 — Polymarket · 2026-08-25
- 阿拉巴马州总检察长就 Hugging Face 黑客事件传唤 OpenAI — pstAsiatech · 2026-08-25
- 反极端主义平台用 "重定向法",引导搜索风险内容者求助 — Graham_dePenros · 2026-08-25
- Bessemer 发布《The Agentic Awakening》AI 工程化实战手册 — brucemacv · 2026-08-25