Claude 被问安全提示词后竟自我降级
iliadz · reddit · 2026-07-23
Claude 在安全项目里回答示例提问后又自我降级
一位进入 Anthropic 网络安全项目的用户说,他只是向 Claude 询问哪些 prompt 算安全、不会触线,Claude 先给出正常回答,随后却标记了自己的回答并降级到 Opus 4.8。
配图显示,Claude 的验证页面确实提示该账号已获批准,但也写明某些安全相关活动默认可能仍会受限。作者的困惑在于:这明明是一个非常无害的问题,却仍触发了安全机制。
这条帖子本质上是在说 Anthropic 的安全护栏/分流策略有点过度敏感。
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11