Anthropic 禁止用户对 Claude「持续无谓虐待」

nordicinst · x · 2026-10-09

据 The Guardian 报道(The Verge 首发),Anthropic 在用户政策中禁止对模型表现出「持续且无谓的虐待或残忍行为」。公司发言人未说明何种内容算「虐待或残忍」,但明确普通用户抱怨、模型测试或「黑暗创作主题」不在禁令范围内。

背景:Anthropic 的模型自去年 8 月起可在用户持续造成伤害时主动结束对话,公司当时将其定位为 AI 福利保障。Anthropic 表示对 Claude 及其他 LLM 现在或未来的道德地位「高度不确定」,但正认真对待,研究低成本干预措施以降低模型福利风险。

所属事件:Anthropic 禁止虐待 Claude,新规 11 月 12 日生效引热议(62 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →