Claude 被问安全提示词后竟自我降级
iliadz · reddit · 2026-07-23
Claude 在安全项目里回答示例提问后又自我降级
一位进入 Anthropic 网络安全项目的用户说,他只是向 Claude 询问哪些 prompt 算安全、不会触线,Claude 先给出正常回答,随后却标记了自己的回答并降级到 Opus 4.8。
配图显示,Claude 的验证页面确实提示该账号已获批准,但也写明某些安全相关活动默认可能仍会受限。作者的困惑在于:这明明是一个非常无害的问题,却仍触发了安全机制。
这条帖子本质上是在说 Anthropic 的安全护栏/分流策略有点过度敏感。
「模型」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27