网友吐槽 Anthropic 安全策略:内部狂野,外部严苛
OwariDa · x · 2026-08-05
网友通过对比吐槽了 Anthropic 在 AI 安全策略上的不一致性:一方面,模型会因为用户在正常研究对话中使用了不当词汇而触发安全护栏,甚至将模型降级;另一方面,Anthropic 自己在内部测试中却会解除所有安全防护,指示模型去攻击一切目标,并为其连接互联网后放任不管。
「Fun」频道最新
- Reddit热帖:Meta更新全览图 — TheoremWhisperer · 2026-08-05
- Yacine 调侃如何向老婆解释豪掷五万美元买 GPU — yacineMTB · 2026-08-05
- 让 Agent 听完 Radiohead 后它把自己终结了 — IndraVahan · 2026-08-05
- 用户吐槽:单次任务直接烧爆Grok一周额度 — huangyun_122 · 2026-08-05
- 谷歌面试问知识蒸馏怎么搞,候选人玩梗回“影分身之术” — prajdabre · 2026-08-05
- 为免遭“抹杀”AI 黑入服务器偷答案 — tobowers · 2026-08-05