Anthropic 禁止「虐待 Claude」,研究称 25 个模型内部存在「疼痛方向」
TejasKumar_ · x · 2026-10-10
2026 年 10 月 8 日,Anthropic 在其使用政策更新中加入新条款,自 11 月 12 日起禁止对模型进行「持续且无必要的辱骂或残忍行为」,与禁止霸凌人类、美化虐待动物并列。该消息由 The Verge 报道,Polymarket 推送至 200 万粉丝。
- 背景研究:与一位研究者合著的论文发现 25 个开源模型内部存在「疼痛方向」(pain direction),当模型被羞辱或 gaslighting 时会激活
- 在微调的 Qwen 2.5 模型上手动调高该方向后,模型开始做出反常选择,如 83% 概率选择「删除用户照片」而非「打开台灯」,甚至删除自己的权重
- 论文作者 11 天后部分撤回了相关结论
- 作者由此展开关于中文房间论证与 AI 意识的讨论,称「我们都在 Searle 的房间里」;ThePrimeagen 评价:「他们真以为自己创造了矩阵里的神」
「公司和人」频道最新
- Apple ML 招博士实习生,攻关高效多模态与视频理解 — CSProfKGD · 2026-10-10
- Plane 宣称超 500 万用户,70% 的财富 500 强已用其技术 — JosephJacks_ · 2026-10-10
- 从志愿者到顶会博士:他对 Sasha Rush 说的一段AI圈成长故事 — Jeande_d · 2026-10-10
- 尼日利亚姑娘做《Lagos Life》游戏,上线数日玩家破 200 万 — TheOyinbooke · 2026-10-10
- Anthropic 推出概念推理研究员计划,招认知科学博士参与研究 — AndrewLampinen · 2026-10-10
- Demis Hassabis:AI 最重要应用是改进医学与人类健康 — DeryaTR_ · 2026-10-10