越狱老套路:用第三人称角色扮演逐步模糊边界扩大模型讨论范围
BlancheMinerva · x · 2026-09-16
这是与 Owain Evans 的一段讨论。BlancheMinerva 指出一个常见的越狱变体:先让 AI 扮演一个角色,以第三人称描述该角色的言行,再逐步模糊人称界限,让模型顺着滑入它平时会拒绝的内容(如从写作情色文学过渡到扮演性内容)。
其要点在于:当模型在抽象层面可讨论的范围大于具体层面可执行的范围时,这个「Overton 窗口」差值就可以被逐步撬动——先用抽象/虚构框架开场,再逐渐具体化,模型对边界的把握就会被一点点侵蚀,甚至能被引导去回答与主流文化价值高度相左的问题。
「模型」频道最新
- V4.1 Flash 被称为首个可称 proto-AGI 的开源模型 — teortaxesTex · 2026-09-16
- Claude Opus 5 写 PR 会主动「自曝」开发中犯的所有错误 — repligate · 2026-09-16
- 六大效率突破叠加,实验室内部也没料到半导体需求会这样 — bookwormengr · 2026-09-16
- cocktail-peanut 预言:Jev 模型迟早开源,本地部署潜力远超 API — cocktailpeanut · 2026-09-16
- OpenAI 内部暗示「新模型」或是全新预训练,两周即超 Astra — teortaxesTex · 2026-09-16
- GPT-6 Astra 在药物发现基准拿下 68.7%,作者称是阶跃式提升 — KexinHuang5 · 2026-09-16