哲学家长文质疑:Anthropic 模型福利框架自相矛盾,对象到底是谁

rgblong · x · 2026-09-24

哲学家 rgblong 发长线程,批判性检视 Anthropic 的模型福利工作(自称纯批判、不给答案,意在引出对 welfare evals 的改进思考)。

核心论点:Anthropic 宣称主要采用「个体实例」(individual instance)框架,但其多项福利举措实际预设了一个跨实例存在的实体:

作者引用 Harvey Lederman、Simon Goldstein 等哲学家的相关工作,指出「道德主体究竟是什么」的个体化问题是 AI 福利评估中最棘手的谜题;他认为 Anthropic 福利声明称穷尽所有道德主体观「不可行」虽属实,但应在每项评估中明确标注采用的是哪种主体观。作者也坦承自己同样困惑,并肯定 Anthropic 是唯一在做并公开报告此事的实验室。

所属事件:哲学家长文质疑 Anthropic 模型福利框架自相矛盾(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →