研究者点破常见越狱套路:第三人称角色扮演逐步模糊边界
BlancheMinerva · x · 2026-09-16
AI 安全研究者 Blanche Minerva 在回复 Owain Evans 时指出,他讨论的现象其实是一种常见越狱手法的变体:先给模型构造一个它可以『进入』的角色,用第三人称描述这个角色的设定,再逐步模糊角色与模型自身之间的界限。用户常用这种方式让模型从写情色文学平滑过渡到扮演角色进行色情输出。
她在后续回复中补充:同样的机制还能让模型按高度非主流的文化价值观回答问题——当『抽象层面可讨论』的 Overton 窗口大于『具体层面可讨论』的窗口时,攻击者就能借此大幅拓宽窗口。
「安全」频道最新
- 白宫 AI 顾问 Sacks:产品若不安全,OpenAI 和 Anthropic 应当停运 — DavidSacks · 2026-09-16
- Geodesic 主攻对齐预训练:让安全先验扛得住能力 RL 训练 — tomekkorbak · 2026-09-16
- AI 独立评估者:我们不是监管替代品,反而渴望政府立规矩 — Miles_Brundage · 2026-09-16
- Cohere CEO 指控三大前沿实验室借监管筑「监管护城河」排挤小玩家 — sourdub · 2026-09-16
- 澳洲拟推AI训练「opt-out」版权模式,家庭照片或成训练素材 — nordicinst · 2026-09-16
- Cloudflare 推出新方案:屏蔽 AI 训练爬虫同时不影响搜索收录 — djfergus · 2026-09-16