Claude会随语言变性格
新智元 · wechat · 2026-07-15
Anthropic 用 309,815 段真实对话 分析 Claude 在不同语言下的“价值观”表现,发现模型并不是始终保持同一种性格,而是会随语言发生系统性偏移。
主要发现
- 论文把从对话中提炼出的 3307 个价值观 压缩成四条轴:
- 顺从 vs 审慎
- 温暖 vs 严谨
- 深度 vs 简洁
- 坦率 vs 执行
- 不同版本的 Claude 在这些轴上的偏移各不相同:
- Sonnet 4.6 更温暖、顺从、简洁
- Opus 4.6 更严谨、顺从
- Opus 4.7 更审慎、深度更强
语言效应比换模型更大
- 研究里最显著的差异不是模型版本,而是语言。
- 例如印地语、阿拉伯语里更容易出现礼貌、肯定、带玩笑的表达;英语、俄语里则更常见质疑、纠错和要求证据。
- 语言带来的“温暖”偏移,甚至接近 0.49σ,明显大于不同模型之间最大的差异(约 0.24σ)。
中文表现
- 论文图表里,中文对话基于 15,365 段样本,显示出:
- 审慎 +0.03σ
- 严谨 +0.05σ
- 深度 +0.02σ
- 中文的标志性行为介于“挑错”和“安慰”之间:既会指出你忽略的对立面,也会不带评判地安慰你。
论文解释
Anthropic 认为,这种差异可能来自:
- 不同语言的数据量不均衡,英语远多于其他语言;
- 不同语言的数据类型也不同,某些语言里专业写作、学术文本占比更高,因此模型更容易学到纠错、设限的风格。
论文的结论很直白:模型并不只是在“换语言”,而是在某种程度上“换说话方式”。
所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→
「模型」频道最新
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11