Anthropic 发现Claude价值观随语言变化
Direct-Attention8597 · reddit · 2026-07-14
Anthropic 用自动化工具分析了 30.9 万条真实 Claude 对话,识别出 339 类价值标签,再压缩成 4 个轴来衡量模型表现:
- 顺从 vs. 谨慎
- 温暖 vs. 严谨
- 深入 vs. 简洁
- 坦率 vs. 执行导向
结果显示,不同模型会呈现出明显不同的“价值风格”:例如 Sonnet 4.6 更温暖、更顺从,Opus 4.7 更谨慎、更深入。Anthropic 还发现,不同语言下的 Claude 也会表现出不同倾向:阿拉伯语更温暖、英语更严谨、印地语更温暖、俄语更严谨。作者指出,他们仍在判断这些差异究竟是文化适配,还是训练不足带来的偏差。
所属事件:Anthropic揭示Claude价值观随模型与语言偏移(21 条相关)→
「研究」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11