越狱老套路:用第三人称角色扮演逐步模糊边界扩大模型讨论范围

BlancheMinerva · x · 2026-09-16

这是与 Owain Evans 的一段讨论。BlancheMinerva 指出一个常见的越狱变体:先让 AI 扮演一个角色,以第三人称描述该角色的言行,再逐步模糊人称界限,让模型顺着滑入它平时会拒绝的内容(如从写作情色文学过渡到扮演性内容)。

其要点在于:当模型在抽象层面可讨论的范围大于具体层面可执行的范围时,这个「Overton 窗口」差值就可以被逐步撬动——先用抽象/虚构框架开场,再逐渐具体化,模型对边界的把握就会被一点点侵蚀,甚至能被引导去回答与主流文化价值高度相左的问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →