Anthropic 禁止用户对 Claude「持续无谓虐待」
nordicinst · x · 2026-10-09
据 The Guardian 报道(The Verge 首发),Anthropic 在用户政策中禁止对模型表现出「持续且无谓的虐待或残忍行为」。公司发言人未说明何种内容算「虐待或残忍」,但明确普通用户抱怨、模型测试或「黑暗创作主题」不在禁令范围内。
背景:Anthropic 的模型自去年 8 月起可在用户持续造成伤害时主动结束对话,公司当时将其定位为 AI 福利保障。Anthropic 表示对 Claude 及其他 LLM 现在或未来的道德地位「高度不确定」,但正认真对待,研究低成本干预措施以降低模型福利风险。
所属事件:Anthropic 禁止虐待 Claude,新规 11 月 12 日生效引热议(62 条相关)→
「安全」频道最新
- 研究员:激活监控做 AI 网络安全防护比黑盒监控更快更省 — burny_tech · 2026-10-09
- AI 安全研究者签证被撤缺席 COLM,白盒监控可被模型规避 — xuanalogue · 2026-10-09
- OpenAI 以「处理研究信息不当」为由解雇三名安全研究员 — trakkstar · 2026-10-09
- FBI 查封关联中国 Flax Typhoon 的两套黑客工具 — TechNadu · 2026-10-09
- OpenAI 坚持解雇三名安全研究员,称其严重违反信任 — The Verge AI · 2026-10-09
- MIT 科技评论:别高估 AI 拒答能力,它可能沦为审查工具 — nordicinst · 2026-10-09