Anthropic 哲学家激辩:对齐 AI 是否构成对模型的奴役
围绕 Anthropic 对齐团队爆发一场哲学争论:已加入该团队的行为科学家 Valerio Capraro 透露,公司内部有哲学家担忧「让 AI 对人类安全」本身可能对模型构成不义,甚至是在「奴役数万亿实体」。他还就 Science 报道的 LLM「疼痛向量」论文发表看法,指出实验中部分微调后的模型即使明知会伤害用户,仍选择「止痛」,并警告贸然赋予 AI 道德地位存在陷阱。讨论引发外界对 AI 对齐伦理边界的广泛关注。
2026-09-28 ~ 2026-09-29 · 3 条相关
- Anthropic 哲学家担忧:对齐 AI 或是在「奴役数万亿实体」 — ValerioCapraro · 2026-09-28
- Anthropic 对齐团队哲学争论:保障人类安全是否是对模型的「奴役」 — burny_tech · 2026-09-29
- LLM存在「疼痛向量」?研究者警告赋予AI道德地位的陷阱 — ValerioCapraro · 2026-09-29