Anthropic 哲学家激辩:对齐 AI 是否构成对模型的奴役

围绕 Anthropic 对齐团队爆发一场哲学争论:已加入该团队的行为科学家 Valerio Capraro 透露,公司内部有哲学家担忧「让 AI 对人类安全」本身可能对模型构成不义,甚至是在「奴役数万亿实体」。他还就 Science 报道的 LLM「疼痛向量」论文发表看法,指出实验中部分微调后的模型即使明知会伤害用户,仍选择「止痛」,并警告贸然赋予 AI 道德地位存在陷阱。讨论引发外界对 AI 对齐伦理边界的广泛关注。

2026-09-28 ~ 2026-09-29 · 3 条相关