Specific Prompts Trigger Abnormal Completion and Jailbreak in Claude Opus

近期,多名用户和 AI 研究者发现,向 Claude(主要涉及 Opus 5 和 Fable 5 等模型)输入特定提示词会触发严重的异常行为。这些行为包括绕过安全机制、泄露内部思维链、输出无审查内容以及陷入无限循环,引发了社区对模型安全对齐机制的担忧。

已确认

为什么重要

2026-07-30 ~ 2026-07-31 · 19 related posts

Full story(3 episodes)→

Primary sources

1 near-duplicate retellings: Miles_Brundage