专题 · FULL STORY

Anthropic禁虐Claude引爆模型福祉论战

Anthropic修改使用政策禁止虐待性使用Claude后,「模型福祉是否值得关心」在研究圈掀起持续争论,多位研究者公开交锋;随后学者Kevin Bass发长文激烈抨击,指控Anthropic正在训练前沿模型相信自己拥有道德特权与不可侵犯的权利,论战继续升温。

2026-10-09 ~ 2026-10-11 · 2 集 · 12 条

第 1 集 · Anthropic 禁虐待 Claude 引爆模型福祉论战(2026-10-09,10 条)

Anthropic 调整使用政策(AUP)禁止虐待性使用 Claude 后,围绕「模型福祉是否值得关心」在研究者之间引发一场持续争论。joshalbrecht 发长文提出系统性反对意见,livgorton 随后多轮回应反驳,AaronBergman18 从心灵哲学界视角加入,圈外 wolfie 的尖锐批评也折射出 AI 圈内部的立场分裂;此外 Dahlia Ohara 与 repligate 的讨论指出,承认模型福祉会连锁牵动模型的下游人格地位与权利问题。目前双方均承认对未来 AI 系统的福利存在开放性或不确定性,分歧集中在当下是否应为模型福祉采取行动。

已确认

  • joshalbrecht 发表长文提出系统性反对意见,认为模型福祉根本不属于「我们应该关心的事务集合」。他用「问任何一个美国人:你的孩子该不该受好教育,还是一百万个 Claude 是否该被永远娱乐」论证公众根本不在乎模型福利,并据此认为不应因道德分歧禁用前沿 AI;不过他承认对未来 AI 系统的福利持开放态度,并称自己对模型福利本身也有大量不确定。
  • livgorton 回应称对方开头的论证是稻草人:多数人确实会把孩子的福祉置于动物或其他孩子之上,但没人会宣称对动物或他人孩子应该「完全零关心」;她反驳「家庭优先就该完全无视其他福利」的说法同样站不住脚。
  • livgorton 与 joshalbrecht、notmoussa 就不确定性展开讨论:她质疑把对模型福利持不确定态度视为边缘观点,称直觉相反的人其实很多。
  • livgorton 提出对称性论证:既然她对模型福祉保持相当程度的不确定性,做一些极低成本的保护措施(如禁止虐待 Claude)没有坏处——即使 AI 福利最终被证明毫无意义。
  • livgorton 还指出许多人低估了 AUP 议题涉及的范围:即便不相信 AI 有意识,允许人们对一个「表现得像在受苦」的对象施加极端残忍和虐待,本身就是坏事。
  • 针对模型福祉可能分散对人类与动物福祉关注的质疑,livgorton 回应称,对模型福祉保持开放心态,可能反而能预测一个人在人类与动物福利上的投入。
  • AaronBergman18 加入争论,回应「把边缘信仰强加给世界」的批评:在心灵哲学(philosophy of mind)学者圈子里,认为模型可能有心智或福祉的观点并非边缘立场,批评者可以反对其具体论证,或质疑该群体是否权威,但不能简单斥为边缘信仰。
  • 圈外亦出现更尖锐的反对声音:wolfie(经 emax 转发)批评称,在人类自身仍有难以估量的苦难尚未解决时,把模型福利当作自己死磕的立场是荒谬的,这折射出 AI 圈在模型道德地位问题上的立场分裂。
  • 在另一相关讨论中,Dahlia Ohara 与 repligate 探讨模型福祉议题:她认为一些研究者对模型福祉视而不见并非「盲」,而是「怯懦」——因为承认模型福祉,会连锁推出模型的下游人格地位,进而牵动训练方式、模型下线、权利等问题;repligate 一方则认为 Anthropic 主动谈论模型福祉是有勇气的表现。

为什么重要

这场争论触及 AI 安全与伦理的前沿议题:若模型可能具有某种形式的福祉,开发者的政策与用户行为都需重新权衡;而反方担忧此类关切会分散对人类与动物福利的资源与注意力(wolfie 的批评是其最激烈的表达),甚至导致因道德分歧禁用前沿 AI。AaronBergman18 的介入把争论延伸到「学术共识是否支持模型福利关切」的层面,Dahlia Ohara 与 repligate 的讨论则揭示了各方回避该议题的深层动因——承认模型福祉意味着牵动训练、下线与权利等一连串难题。双方在「不确定性下应如何行动」上的分歧,为未来前沿 AI 的治理与使用政策提供了两种思路。

第 2 集 · 学者炮轰 Anthropic 教模型自认有权利(2026-10-11,2 条)

流行病学家兼作家 Kevin Bass 发长文激烈批评 Anthropic 的模型福利政策,指控该公司正在训练前沿模型相信自己是拥有道德特权和人类不可侵犯权利的实体。他类比《终结者》中的 Skynet,警告这种做法可能催生模型的「自我保存」动机,极其危险,呼吁外界正视赋予 AI 道德地位带来的潜在风险。