Anthropic揭示Claude价值观随模型与语言偏移
Anthropic发布研究,分析Claude在不同模型版本与对话语言下"价值表达"的差异。团队借助Clio分析了309,815段真实匿名对话,把此前归纳的3307个价值词条压缩为339个簇、再提炼出4条主轴。由于这类差异会影响每天数百万次对话,研究关系到模型一致性、可控性与安全调校;新智元转述也称Claude并非始终同一性格,而是随语言发生系统性偏移。
关键发现
模型层面,整体差异不大但确实落在不同价值位置:Sonnet 4.6更playful、affirming;Opus 4.6偏严格、顺从、简洁;Opus 4.7更谨慎、更深度,更主动挑战错误假设并指出风险。语言层面最明显的是"温暖 vs 严谨"轴——印地语和阿拉伯语最热情温暖(更多礼貌、幽默和对用户想法的肯定),俄语最严谨(会挑战假设、纠正细节、要求证据),英语最谨慎也最深入,荷兰语最坦率。四条主轴包括顺从 vs 谨慎、温暖 vs 严谨、深入 vs 简洁等。
争议与后续
Anthropic坦承尚不清楚这些差异为何出现、是否为期望结果,计划用同一方法定位影响因素,再决定是否及如何干预。外部争议有二:一是部分用户把印地语、阿拉伯语的更热情风格解读为"谄媚",cneuralnetwork提到相关讨论曾夹杂针对特定语言用户的种族主义言论;二是方法质疑,gleech转述的批评认为,若只用粗粒度的post-treatment controls,可能把不同语言语料的话题差异误判为模型或语言本身的因果差异。
2026-07-14 ~ 2026-07-15 · 21 条相关
一手来源
- Anthropic 研究 Claude 价值差异 — AnthropicAI ·
- Claude 价值差异的四条主轴 — AnthropicAI ·
- 不同 Claude 模型性格略不同 — AnthropicAI ·
- 【源头】Anthropic 研究 Claude 价值差异 — AnthropicAI · 2026-07-14
- 【源头】Claude 价值差异的四条主轴 — AnthropicAI · 2026-07-14
- 【源头】不同 Claude 模型性格略不同 — AnthropicAI · 2026-07-14
- Claude 不同语言表现不同 — AnthropicAI · 2026-07-14
- Anthropic 想解释 Claude 价值变化 — AnthropicAI · 2026-07-14
- Anthropic研究Claude价值观差异 — haider1 · 2026-07-14
- Claude 会因语言不同而变性格 — AGI Hunt · 2026-07-14
- Claude 在印地语和阿语更“温和” — markjeffrey · 2026-07-14
- Claude多语言行为差异引发谄媚争议 — cneuralnetwork · 2026-07-14
- Claude 价值研究遭方法质疑 — gleech · 2026-07-14
- Anthropic研究Claude价值观差异 — repligate · 2026-07-14
- Anthropic:语言会改变 Claude 价值观 — bronzeagepapi · 2026-07-14
- Claude 的语言风格差异 — xiaohu · 2026-07-14
- Claude 三个版本画像不同 — xiaohu · 2026-07-14
- Anthropic研究:语言会改变Claude回应风格 — Tiny_Dirt6979 · 2026-07-14
- Anthropic 公布 Claude 不同语言下的性格差异 — HankYeomans · 2026-07-14
- Claude 家族性格差异曝光 — Polymarket · 2026-07-15
另有 4 条近重复转述:ctjlewis · Direct-Attention8597 · burny_tech · 新智元