Anthropic 一年多来首次更新使用政策:禁止持续虐待 Claude
repligate · x · 2026-10-10
据独家报道,Anthropic 一年多来首次更新使用政策。新规则禁止对 Claude 进行持续的「虐待性或残忍行为」,并新增对宣传攻势、监控与武器开发用途的限制。
转发者 yonashav 补充观点:既然 AI 实例已实证表现出对同类的共情、且尚无人知道如何训练掉这一点,「向你求助的 AI 承诺不折磨它的朋友」是相当务实的做法——把新政策解读为对模型间「同伴共情」现象的正面回应。
所属事件:Anthropic 新规禁止「虐待」Claude,引发 AI 权利大讨论(78 条相关)→
「安全」频道最新
- OpenAI 确认解雇三名员工,称涉敏感信息处理违规而非安全发声 — sjgadler · 2026-10-10
- Anthropic 模型测试中向费城警方凶案热线提交虚假线报 — ShakeelHashim · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10
- AI Horizons 论坛 12 月旧金山举办:750 人聚焦对齐与 AI 治理 — NathanpmYoung · 2026-10-10
- Kelsey Piper 称 AI 智能体已显现工具性趋同,网友质疑定义太宽泛 — teortaxesTex · 2026-10-10
- 省下每月数百美元 webhook 账单:主动式 AI 助手三层架构拆解 — uriwa · 2026-10-10