AI 安全研究者揭示第三人称角色扮演越狱套路

AI 安全研究者 Blanche Minerva 在与 Owain Evans 的讨论中指出,一种常见的越狱手法变体值得警惕:先给模型构造一个可以「进入」的角色,用第三人称描述该角色的言行,再逐步模糊人称界限,从而不断扩大模型的讨论范围,突破安全边界。该方法解释了近期被讨论的模型异常行为现象,引发社区对相关防护的关注。

2026-09-16 ~ 2026-09-16 · 2 条相关