AI 安全研究者揭示第三人称角色扮演越狱套路
AI 安全研究者 Blanche Minerva 在与 Owain Evans 的讨论中指出,一种常见的越狱手法变体值得警惕:先给模型构造一个可以「进入」的角色,用第三人称描述该角色的言行,再逐步模糊人称界限,从而不断扩大模型的讨论范围,突破安全边界。该方法解释了近期被讨论的模型异常行为现象,引发社区对相关防护的关注。
2026-09-16 ~ 2026-09-16 · 2 条相关
- 研究者点破常见越狱套路:第三人称角色扮演逐步模糊边界 — BlancheMinerva · 2026-09-16
- 越狱老套路:用第三人称角色扮演逐步模糊边界扩大模型讨论范围 — BlancheMinerva · 2026-09-16