研究者公开反驳 MacAskill:不应把 Claude 的不确定表述当独立证据

rgblong · x · 2026-09-19

AI 安全研究者 rgblong 公开表态,反驳 Will MacAskill 与 Lucius Caviola 在一篇评论文章中对 Claude 模型行为证据的使用方式(自注:借 Richard Ngo 与 Oliver Habryka 的风格,公开反驳自己认同其价值观的朋友)。

核心论点:

这是一个关于如何解读模型自述行为的认识论争论,涉及模型表达与训练目标之间的循环论证问题。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →