探讨:长文本致激活漂移绕过 LLM 安全机制
Historical-Cod-2537 · reddit · 2026-08-08
一位开发者通过实验发现了一个有趣的现象:向经过 RLHF 对齐的大模型输入长篇无害文本(不含任何指令),会导致模型中后层的激活值发生明显且持久的偏移。这种偏移能够直接瓦解模型的安全护栏,且无需任何显式的越狱提示词。
作者借此探讨了模型内部“世界模型”的运作机制,推测上下文可能将模型推入训练时形成的特定区域,从而完全绕过安全设置,并邀请社区共同验证这些可复现的指标。
「安全」频道最新
- Sam Altman 谈 ChatGPT 审查制度,发问谁将首发无审查 AI — borowcy · 2026-08-08
- AI引发安全事件激增,企业面临响应与监管风暴 — philvenables · 2026-08-08
- Anthropic 将 Claude Code 默认设为 Auto 模式 — The Decoder · 2026-08-08
- Wired 调查:大量敏感信息被发往 noreply 邮箱,AI 工具可读取 — sbulaev · 2026-08-08
- Simon Willison解析OpenAI攻击HF事件:RLVR训练或为失控根源 — Simon Willison · 2026-08-08
- AI医疗记录引担忧:超3%病历遗漏关键信息 — FreshFromCache · 2026-08-08