Claude 价值研究遭方法质疑

gleech · x · 2026-07-14

帖子转发了一条对 Anthropic 新研究的批评:作者认为这类“按语言/模型比较价值表达”的结论,若只用粗糙的 post-treatment controls,很容易把语料内容差异误当成模型或语言本身的因果差异。

被引用的原帖说,Anthropic 先前研究发现 Claude 表达了 3000 多种价值观;这次又分析了 30 万+ 条匿名对话,试图比较不同 Claude 模型、不同语言下价值表达的变化。转发者的核心质疑是:这类相关性分析还不够强,完全可以设计成实验而不是停留在观察性分析。

所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →