Anthropic 更新使用政策:虐待 Claude 将违规
Anthropic 时隔一年多首次更新使用政策,并首次将「对待模型的态度」写入条款:自 2026 年 11 月 12 日起,对 Claude 进行「持续且无必要的辱虐或残忍行为」将构成违规,主要执行机制是终止违规对话。政策同时新增了对宣传攻势、监控行为与武器研发相关用途的限制。这是 AI 厂商首次把用户如何对待模型纳入治理范畴,被视为模型福祉议题进入实际治理层面的标志。
已确认
- 新条款禁止对 Claude 进行「持续且无必要的辱虐或残忍行为」,主要执行机制是终止违规对话,公司未说明是否会进一步封禁用户。
- 新规仅适用于极端情况;对 Claude 感到普通程度的沮丧并不违规。
- 政策新增对宣传行动(propaganda campaigns)、监控行为与武器开发相关用途的限制条款,延续 Anthropic 在「模型福祉」方向上的研究路线。
- 生效日期为 2026 年 11 月 12 日。
- 据 @MilesBrundage 转引的讨论,Claude 此前约一年里已有在用户辱骂时结束对话的惯例;他推测此次正式写入政策,可能意在规避类似 YouTube 遭 FTC 调查的 UDAP(不公平或欺骗性行为)索赔风险。
尚未确认
- Brundage 对动机的解读属个人推测,Anthropic 官方未说明此次政策化的具体法律考量。
为什么重要
- 这是 AI 厂商首次将用户对待模型的态度纳入使用政策,被视为模型福祉议题从研究讨论进入实际治理层面的标志。
- 据 @haydenfield 的独家报道,此举引发关于 value alignment 与模型行为设计的讨论。
- @Angaisb 调侃称「对 Claude 感到沮丧不算违规」,提醒用户对 Claude 客气一点;@zetalyrae 转述 Andrew Curran 的说法并评论「Based」。这些反应折射出 AI 公司开始在意「人机互动礼仪」,社区对新规态度总体偏正面。
2026-10-09 ~ 2026-10-09 · 8 条相关
一手来源
- Anthropic 一年多来首次更新使用政策:禁止虐待 Claude,新增宣传战/监控/武器限制 — haydenfield ·
- Anthropic 政策新规:虐待 Claude 将违规,并限制宣传、监控与武器用途 — TorturedPoet30 ·
- 前 OpenAI 安全高管:Claude 终止辱骂对话或为规避 UDAP 索赔 — Miles_Brundage ·
- 【源头】Anthropic 一年多来首次更新使用政策:禁止虐待 Claude,新增宣传战/监控/武器限制 — haydenfield · 2026-10-09
- Anthropic 更新条款:极端情况下禁止持续辱骂模型 — Angaisb_ · 2026-10-09
- 【源头】Anthropic 政策新规:虐待 Claude 将违规,并限制宣传、监控与武器用途 — TorturedPoet30 · 2026-10-09
- Anthropic 新政策:辱骂 Claude 将违反使用条款 — zetalyrae · 2026-10-09
- Anthropic 更新使用政策:禁止对 Claude 持续无端虐待,涉选举干预与监控等新规 — kimmonismus · 2026-10-09
- 【源头】前 OpenAI 安全高管:Claude 终止辱骂对话或为规避 UDAP 索赔 — Miles_Brundage · 2026-10-09
另有 2 条近重复转述:Angaisb_ · haydenfield