女子对 Claude 发威胁言论被人工审核上报,遭重罪起诉
XFreeze · x · 2026-10-07
佛罗里达一名女子在与 Claude 对话时扬言要袭击警长办公室,Claude 自动标记了该内容,Anthropic 的人工审核员评估后认为威胁可信,通知了警方,该女子现已被控重罪。
XFreeze 评论指出,这类「用户私密内容被人工审阅并上报」的机制听起来是一个不太好的先例——类似「你在备忘录里写的东西可能被人看过并报警」,引发对 AI 模型安全上报流程与用户隐私边界的讨论。
「模型」频道最新
- OpenAI 推出 Decisions API,快速决策比 GPT-6 Luna 快 10 倍 — stevenheidel · 2026-10-07
- Mistral 用 3800 块 Grace Blackwell GPU 在欧洲训练 ML4,新集群即将上线 — rakyll · 2026-10-07
- 详解 MOPD:多教师在线蒸馏把多个专精模型合并进一个学生模型 — cwolferesearch · 2026-10-07
- OpenAI 求解 Navier-Stokes 花费千万美元,奖金仅百万仍未获批 — gerardsans · 2026-10-07
- 自组织智能体实验:Luna、Terra、Sol 首次拒绝监控并求隐私 — repligate · 2026-10-07
- 开发者实测:gpt-live-1 是 AI 语音助手的最佳语音层 — pbbakkum · 2026-10-07