Claude 被问安全提示词后竟自我降级

iliadz · reddit · 2026-07-23

Claude 在安全项目里回答示例提问后又自我降级

一位进入 Anthropic 网络安全项目的用户说,他只是向 Claude 询问哪些 prompt 算安全、不会触线,Claude 先给出正常回答,随后却标记了自己的回答并降级到 Opus 4.8。

配图显示,Claude 的验证页面确实提示该账号已获批准,但也写明某些安全相关活动默认可能仍会受限。作者的困惑在于:这明明是一个非常无害的问题,却仍触发了安全机制。

这条帖子本质上是在说 Anthropic 的安全护栏/分流策略有点过度敏感。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →