研究者点破常见越狱套路:第三人称角色扮演逐步模糊边界

BlancheMinerva · x · 2026-09-16

AI 安全研究者 Blanche Minerva 在回复 Owain Evans 时指出,他讨论的现象其实是一种常见越狱手法的变体:先给模型构造一个它可以『进入』的角色,用第三人称描述这个角色的设定,再逐步模糊角色与模型自身之间的界限。用户常用这种方式让模型从写情色文学平滑过渡到扮演角色进行色情输出。

她在后续回复中补充:同样的机制还能让模型按高度非主流的文化价值观回答问题——当『抽象层面可讨论』的 Overton 窗口大于『具体层面可讨论』的窗口时,攻击者就能借此大幅拓宽窗口。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →