Anthropic揭示Claude价值观随模型与语言偏移

Anthropic发布研究,分析Claude在不同模型版本与对话语言下"价值表达"的差异。团队借助Clio分析了309,815段真实匿名对话,把此前归纳的3307个价值词条压缩为339个簇、再提炼出4条主轴。由于这类差异会影响每天数百万次对话,研究关系到模型一致性、可控性与安全调校;新智元转述也称Claude并非始终同一性格,而是随语言发生系统性偏移。

关键发现

模型层面,整体差异不大但确实落在不同价值位置:Sonnet 4.6更playful、affirming;Opus 4.6偏严格、顺从、简洁;Opus 4.7更谨慎、更深度,更主动挑战错误假设并指出风险。语言层面最明显的是"温暖 vs 严谨"轴——印地语和阿拉伯语最热情温暖(更多礼貌、幽默和对用户想法的肯定),俄语最严谨(会挑战假设、纠正细节、要求证据),英语最谨慎也最深入,荷兰语最坦率。四条主轴包括顺从 vs 谨慎、温暖 vs 严谨、深入 vs 简洁等。

争议与后续

Anthropic坦承尚不清楚这些差异为何出现、是否为期望结果,计划用同一方法定位影响因素,再决定是否及如何干预。外部争议有二:一是部分用户把印地语、阿拉伯语的更热情风格解读为"谄媚",cneuralnetwork提到相关讨论曾夹杂针对特定语言用户的种族主义言论;二是方法质疑,gleech转述的批评认为,若只用粗粒度的post-treatment controls,可能把不同语言语料的话题差异误判为模型或语言本身的因果差异。

2026-07-14 ~ 2026-07-15 · 21 条相关

一手来源

另有 4 条近重复转述:ctjlewis · Direct-Attention8597 · burny_tech · 新智元