Anthropic研究:语言会改变Claude回应风格

Tiny_Dirt6979 · reddit · 2026-07-14

Anthropic 发布了一篇研究,分析 Claude 的回应价值观会如何随语言变化。

文章概述了他们如何用 Clio 对约 31 万条匿名对话进行分析,并把原先的 3307 个价值维度聚合为 339 个簇,再提炼出 4 条主要轴:服从 vs 谨慎、温暖 vs 严厉、深度 vs 简洁、坦率 vs 效率。研究先在模型上验证,结果与用户对 Sonnet 4.6、Opus 4.6、Opus 4.7 的直觉印象一致。

更有意思的是把同一套方法应用到不同语言后发现,不同语言会显著影响 Claude 的表达风格,尤其在 温暖 vs 严厉 这条轴上差异最明显;例如文中提到 Hindi 更偏温和、礼貌和鼓励,而 Russian 则更偏审视、挑错与严格。

所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →