Anthropic 用户新政明令禁止对 Claude 持续辱骂,违规将终止对话
kimmonismus · x · 2026-10-09
Anthropic 在更新的 2026 用例政策中首次明文禁止「对模型持续且无必要的辱骂或残忍行为」。据 The Verge 报道,主要执行机制仍是终止对话;政策只针对极端、重复、无目的的残忍对待,普通情绪发泄、对抗性测试和黑暗创作主题不在禁止之列。但已有不少用户发现 Claude 在并不极端的对话中也会提前结束会话,这一情况可能进一步加剧。
所属事件:Anthropic 新规:持续辱虐 Claude 将违规,引发拟人化争议(21 条相关)→
「安全」频道最新
- ChatGPT 编造判例致律师被停职,视频复盘 AI 幻觉司法翻车 — dadakoglu · 2026-10-09
- 用户撤销权限后 Codex 仍可读写旧文件夹,且官方无法解释 — Some-Following-392 · 2026-10-09
- 美国众议院 AI 伤害草案:模型公司担责,除非 agent 开发者有疏忽 — serendip-ml · 2026-10-09
- Anthropic 推 OSS Scanner:免费为开源项目做 AI 安全扫描 — The Verge AI · 2026-10-09
- Veracode 报告:AI 写近半代码,安全通过率仅 56% — WeldPond · 2026-10-09
- Phrack 第 73 期刊发漏洞研究传奇 Halvar Flake 深度人物专访 — WeldPond · 2026-10-09