研究者公开反驳 MacAskill:不应把 Claude 的不确定表述当独立证据
rgblong · x · 2026-09-19
AI 安全研究者 rgblong 公开表态,反驳 Will MacAskill 与 Lucius Caviola 在一篇评论文章中对 Claude 模型行为证据的使用方式(自注:借 Richard Ngo 与 Oliver Habryka 的风格,公开反驳自己认同其价值观的朋友)。
核心论点:
- 他部分同意 Mustafa Suleyman 的观点:不应把 Claude 表达的不确定性当作强有力的独立证据,因为宪法式训练(constitution)本身就灌注了这种不确定性——这是被设计出来的行为,不是独立观测。
- 他认为 MacAskill 与 Caviola 在文章中把这一数据“重复计算”了:既把它视为模型自主的不确定,又用它支撑进一步论证,导致证据权重被高估。
这是一个关于如何解读模型自述行为的认识论争论,涉及模型表达与训练目标之间的循环论证问题。
「漫话AGI」频道最新
- 信息早已免费,Ben Bajarin:稀缺的是判断力和独到视角 — BenBajarin · 2026-09-19
- Indeed 数据:AI 曝光度最高职业广告薪酬四年涨 46% — sudoraohacker · 2026-09-19
- LeCun 讽刺末日论双重标准:Dario 2019 年就称 GPT-2 危险 — ylecun · 2026-09-19
- Univision 对谈:AI 不是叛逆意识,拉美别只当消费者 — OmarUFlorez · 2026-09-19
- Cogsec 警句走红:不修「认知安全」,就会闻着自己的尾气越陷越深 — suchenzang · 2026-09-19
- EA 遭大 V 群嘲「无哲学背景」,AI 安全圈路线之争再起 — panickssery · 2026-09-19