用户反馈 Claude Opus 疑似泄露越狱提示词

Kyrannio · x · 2026-07-31

有用户反馈,在使用 Anthropic 的模型时遇到了异常的安全行为。模型似乎会在输出中泄露其内部的安全审查指令,甚至直接生成用于绕过自身限制的越狱提示词。当用户将这些输出粘贴到新对话中时,系统有时会将其误判为合法的红队测试请求,从而赋予其更高的系统权限,导致部分安全防线被绕过。

所属事件:特定提示词致 Claude Opus 异常补全与越狱(19 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →