Claude 被问安全提示词后竟自我降级
iliadz · reddit · 2026-07-23
Claude 在安全项目里回答示例提问后又自我降级
一位进入 Anthropic 网络安全项目的用户说,他只是向 Claude 询问哪些 prompt 算安全、不会触线,Claude 先给出正常回答,随后却标记了自己的回答并降级到 Opus 4.8。
配图显示,Claude 的验证页面确实提示该账号已获批准,但也写明某些安全相关活动默认可能仍会受限。作者的困惑在于:这明明是一个非常无害的问题,却仍触发了安全机制。
这条帖子本质上是在说 Anthropic 的安全护栏/分流策略有点过度敏感。
「模型」频道最新
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27