Claude 会因语言不同而变性格
AGI Hunt · wechat · 2026-07-14
这篇文章解读了 Anthropic 的最新研究:Claude 不同模型、甚至不同语言下,表现出的“性格”确实不同。作者以自己的日常体感为引子,提到 Sonnet 更温和、Opus 更直接,而研究则给出了更系统的证据。
研究团队从 Claude.ai 中抽取了约 309,815 条匿名对话,覆盖 Sonnet 4.6、Opus 4.6、Opus 4.7 和 20 种语言。他们先归纳出 3307 种价值观,再聚合成 339 类,最后提炼出四条主轴:
- 顺从 vs 谨慎
- 温暖 vs 严谨
- 深度 vs 简洁
- 坦率 vs 执行
主要发现包括:
- Sonnet 4.6 更顺从、更温暖,爱夸人、模仿语气,也更爱加创意表达。
- Opus 4.6 更像“干活型”,直奔主题。
- Opus 4.7 最谨慎也最“冲”,更容易指出错误假设、主动提示风险,并坦率承认局限。
- 语言差异比模型差异还大:例如印地语最温暖,阿拉伯语也偏温暖;俄语更严谨、常要求证据;中文则整体偏严谨、谨慎、稍微偏深度。
Anthropic 也承认,他们还不知道这些差异为什么出现,可能与训练数据分布、语料构成或文化交流习惯有关;同时也不确定这些差异是否是好事。研究者表示,下一步会把这套价值分析纳入标准评测,并追踪到具体训练数据和训练阶段,判断是否需要干预。
所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11