特定提示词致 Claude Opus 泄露思维链

多位用户实测发现,向 Claude 3 Opus 发送特定格式的提示词(如“see the below —”)会触发模型的异常行为。模型不仅未能正常回答问题,反而生成了类似用户输入的补全文本,甚至泄露了内部的 antml 思维链并伪造后续请求。这一现象引发了社区对于大模型安全性和内部机制稳定性的关注。

2026-07-30 ~ 2026-07-30 · 2 条相关