Anthropic研究:语言会改变Claude回应风格
Tiny_Dirt6979 · reddit · 2026-07-14
Anthropic 发布了一篇研究,分析 Claude 的回应价值观会如何随语言变化。
文章概述了他们如何用 Clio 对约 31 万条匿名对话进行分析,并把原先的 3307 个价值维度聚合为 339 个簇,再提炼出 4 条主要轴:服从 vs 谨慎、温暖 vs 严厉、深度 vs 简洁、坦率 vs 效率。研究先在模型上验证,结果与用户对 Sonnet 4.6、Opus 4.6、Opus 4.7 的直觉印象一致。
更有意思的是把同一套方法应用到不同语言后发现,不同语言会显著影响 Claude 的表达风格,尤其在 温暖 vs 严厉 这条轴上差异最明显;例如文中提到 Hindi 更偏温和、礼貌和鼓励,而 Russian 则更偏审视、挑错与严格。
所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11