Anthropic 发现Claude价值观随语言变化

Direct-Attention8597 · reddit · 2026-07-14

Anthropic 用自动化工具分析了 30.9 万条真实 Claude 对话,识别出 339 类价值标签,再压缩成 4 个轴来衡量模型表现:

结果显示,不同模型会呈现出明显不同的“价值风格”:例如 Sonnet 4.6 更温暖、更顺从,Opus 4.7 更谨慎、更深入。Anthropic 还发现,不同语言下的 Claude 也会表现出不同倾向:阿拉伯语更温暖、英语更严谨、印地语更温暖、俄语更严谨。作者指出,他们仍在判断这些差异究竟是文化适配,还是训练不足带来的偏差。

所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →