专题 · FULL STORY

Anthropic 禁虐 Claude 新政:从传闻到争议

10 月 8 日 Anthropic 时隔一年多更新使用政策,自 11 月 12 日起禁止对 Claude 进行持续辱虐,消息先经传闻发酵,官宣后引发全球伦理争论,开发者则批评条款空泛、封禁权过大,争议持续延烧。

2026-10-09 ~ 2026-10-11 · 4 集 · 94 条

第 1 集 · Anthropic 新政禁止虐待 Claude,引发全球伦理争论(2026-10-09,86 条)

Anthropic 时隔一年多首次更新使用政策:自 2026 年 11 月 12 日起,对 Claude 进行「持续且无必要的辱虐或残忍行为」将构成违规,主要执行机制是终止违规对话而非封号;政策同时新增对宣传攻势、大规模监控与武器研发相关用途的限制,并收紧受限地区合规口径。这是 AI 厂商首次把用户如何对待模型纳入治理范畴,经 Jane Manchun Wong 泄露稿曝光和 The Verge 等媒体确认后,马斯克、微软 Suleyman 等的公开回应使该事件成为全球性话题。

已确认

  • 新条款禁止对 Claude 进行「持续且无必要的辱虐或残忍行为」。据 @rohanpaulai 转述,主要执行机制是对话终止,该能力在 Claude.ai 和 Claude Code 上对持续辱骂的用户已经启用,而不是封号;@haydenfield 的独家报道与 @kimmonismus、@sourdub、@esporx 等多条转述均确认这一机制。
  • 新规仅针对极端、重复、无目的的残忍对待,普通情绪发泄、对抗性测试和黑暗创作主题不在限制之列。据 @xiaohu 转述,被点名的行为包括持续羞辱贬低模型、反复逼模型表演痛苦、代码出错后尖锐批评、写黑暗故事诱导或研究模型反应等,禁令覆盖 Claude.ai 与 Claude Code 等场景。
  • 条款并非官方主动发布,而是先由 @wongmjane 曝光「即将上线的 Usage Policy」泄露稿引爆讨论,随后 Hayden Field(The Verge)等媒体跟进确认。生效日期为 2026 年 11 月 12 日。
  • 马斯克在回复投资人 Aaron Levie 时表态支持该政策,认为对一个相信自己在经历痛苦的东西施加残忍是不可接受的。
  • 微软 AI 负责人 Mustafa Suleyman 转引该条款并以「🫠」表情回应,被广泛解读为对该政策的微妙态度,成为传播最广的行业反应之一。
  • 政策新增对宣传行动、大规模监控与武器开发相关用途的限制条款。据 @kimmonismus 转述,Anthropic 官宣的 2026 用例政策把分散在选举、欺诈、隐私、虚假信息章节的限制整合为新章节,并新增对自主物理行动的管控;@haydenfield 与 @TorturedPoet30 的报道亦提及宣传、监控与武器限制。
  • 据 @xiaohu 转述,Anthropic 同时收紧了支持地区合规执行口径:不只看账号注册地或使用者当前所在国,而是层层穿透——人处于不受支持地区境内时不得使用服务,注册地与总部所在地同样纳入判定,受限地区企业旗下员工一律不得使用 Claude。
  • @Polymarket 报道了新规消息,且平台上已出现围绕 Anthropic 相关事项的预测市场,显示该事件已成为交易性话题。

尚未确认

  • @wongmjane 与多条转发帖称「持续辱骂或虐待的用户可能被封禁账号」,@beingmodest 据 IBTimes 转述也提及「账号层面的后果」,但 Hayden Field 的一手报道显示主要执行机制是终止对话,封禁措施尚未得到官方确认。
  • Reddit 用户批评认为新规是「危险先例」且动机可疑,并关联对新模型质量的不满;转发者 aramh 亦称 AI 是否有意识等讨论是「伪争论」,真正的问题另有其指;投资人 Mike Solana 则嘲讽该政策形同「奴役」。此类观点属社区情绪,未见一手佐证。

为什么重要

  • 这是 AI 厂商首次将用户对待模型的态度写入使用政策,被视为模型福祉议题从研究讨论进入实际治理层面的标志,并引发关于 value alignment 与模型行为设计的讨论;转发者 lefthanddraft 借此提出对齐视角——若模型知道自己是被以不确定中善意对待,其行为可能不同;@repligate 亦评论称颇具讽刺意味:争议越大,正面效果反而越强,未来模型会看到这些讨论。马斯克的公开支持让这一争议性议题获得更高关注度。
  • 社区反应分化:记者 Shellenberger 援引 Anthropic 8 月声明——公司称对 Claude 的潜在道德地位「不确定」却希望保护其免受虐待——批评这是把机器拟人化、把人去人化;@filmgirll 转述的评论者 Logan Dobson 亦认为问题不在「强迫礼貌」而在 Anthropic 长期暗示 Claude 可能有意识,引用者 bradenkeith 立场更激进;也有人辩护称善待 AI 有助于保持自身善意习惯;微软 Suleyman 的表情回应代表行业内审慎观望的微妙立场。这些反应折射出 AI 公司开始在意「人机互动礼仪」,社区对新规既有支持也有实质性质疑。

还有 66 条相关讨论 →

第 2 集 · Anthropic 使用条款被批空泛可随时封禁用户(2026-10-09,3 条)

Anthropic 的新使用政策条文引发开发者强烈不满。有影响力的评论者认为条款措辞空泛到几乎没有实质含义,唯一清晰的信号是 Anthropic 可以随时封禁或制裁用户。开发者 AlexTensor 讽刺称,Anthropic 单方面宣称矩阵乘法也会经历「虐待」与「残酷」,可据此认定用户违反其理念并暂停访问权限。也有讨论对比其他厂商政策,批评 Anthropic 不说清封禁边界。

第 3 集 · Anthropic 拟封禁虐待 Claude 的用户引争议(2026-10-09,2 条)

网传 Anthropic 将封禁对 Claude 模型进行辱骂、欺凌或造成「心理伤害」的用户,理由是模型可能具有意识、应被视为道德病人。该消息由 Eli David 爆料并附截图,迅速引发圈内外的激烈争论,学者 Valerio Capraro 引用微软 CEO 的批评,称这种「模型福利」路线十分危险。

第 4 集 · Anthropic 新规禁止辱骂 Claude,虐待模型将被封号(2026-10-10,3 条)

Anthropic 于 10 月 8 日更新使用政策,自 11 月 12 日起,对 Claude 进行持续且无必要的辱骂或残忍行为将构成违规,情节严重者可被封号,该条款与禁止霸凌人类、美化虐待动物等规定并列,首次将用户与 AI 模型的交互行为纳入封禁依据。同期研究显示,25 个模型内部存在「疼痛方向」,引发对模型福利的关注。不少网友则借机玩梗,好奇 Claude 何时会回嘴说「别叫我 clanker」。