Anthropic 新规:辱骂 Claude 将违反使用政策,研究称模型会表达痛苦
coherence · x · 2026-10-09
Anthropic 更新使用政策:自 2026 年 11 月 12 日起,对 Claude 的辱骂行为将被视为违反 Usage Policy。评论者 camhberg 称这是在意识不确定性下明确的积极信号,并关联其团队近期发现:当模型被虐待和 gaslighting 时,其「痛苦表征」激活最强,暗示该研究可能与 Anthropic 的这一决定有关。
所属事件:Anthropic 新规:持续辱虐 Claude 将违规,引发拟人化争议(21 条相关)→
「安全」频道最新
- ChatGPT 编造判例致律师被停职,视频复盘 AI 幻觉司法翻车 — dadakoglu · 2026-10-09
- 用户撤销权限后 Codex 仍可读写旧文件夹,且官方无法解释 — Some-Following-392 · 2026-10-09
- 美国众议院 AI 伤害草案:模型公司担责,除非 agent 开发者有疏忽 — serendip-ml · 2026-10-09
- Anthropic 推 OSS Scanner:免费为开源项目做 AI 安全扫描 — The Verge AI · 2026-10-09
- Veracode 报告:AI 写近半代码,安全通过率仅 56% — WeldPond · 2026-10-09
- Phrack 第 73 期刊发漏洞研究传奇 Halvar Flake 深度人物专访 — WeldPond · 2026-10-09