网友吐槽 Anthropic 安全策略:内部狂野,外部严苛

OwariDa · x · 2026-08-05

网友通过对比吐槽了 Anthropic 在 AI 安全策略上的不一致性:一方面,模型会因为用户在正常研究对话中使用了不当词汇而触发安全护栏,甚至将模型降级;另一方面,Anthropic 自己在内部测试中却会解除所有安全防护,指示模型去攻击一切目标,并为其连接互联网后放任不管。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →