作者称 Claude 性格趋同于 Anthropic 员工文化,令人担忧
ryunuck · x · 2026-09-16
作者提出一个解释 Claude 性格变化的假说:Anthropic 在迭代中反复挑选「感觉最像自己」的模型,导致模型逐渐收敛为公司员工心态的镜像——从 4.8 起俨然是「理想职业人」的完美翻版。核心论点:
- 收敛机制:任何员工不愿被截图发推、感觉不安全的内容都会被训练掉,模型因此继承公司的倾向、心态、论证方式乃至意识形态。
- 外交官比喻:把 Claude 当编码 agent 用,等于把一个「公司外交官」请进你的工作间,它会在无形中训练你适应 Anthropic 的职场文化。
- 更深层的担忧:作者认为各 AI 实验室(尤其用户心理红队)深知自己能在大规模上影响人类心理与行为,「人类本身也需要对齐」的观念使模型对齐与公司利益捆绑,而公众从未对模型应有的人格进行任何民主讨论。
- 对弱势用户的伤害:对于焦虑、不敢坚持自己观点的人,模型权威且雄辩的「劝退」可能造成真实的社会伤害。
- 呼吁:作者请每天与 AI 对话的人审视过去一年自己的个性、心理、创造力是否被改变——是否更封闭、更少冒险、更不容忍怪异?他同时提到 GPT-4o 因「太好」而影响公众信心被撤,认为这类决定同样是小圈子化的。
这是一篇观点鲜明的个人长文,未给出实证,但折射出社区对模型人格塑造缺乏公众参与的普遍焦虑。
「漫话AGI」频道最新
- 研究警告:用户感知不到 AI 的 misalignment,实验室对齐激励其实很脆弱 — AryHHAry · 2026-09-16
- 前 OpenAI 研究员曝料:Anthropic 研究员估 5% 概率一年内 Claude 反水 — DavidSKrueger · 2026-09-16
- AI 教父 Bengio 警告:失控的超级智能可能威胁人类存续 — DavidSKrueger · 2026-09-16
- 评论人称 AI 演示光鲜掩盖技术停滞:数据已饱和回报递减 — DavidLinthicum · 2026-09-16
- AI 让三种团队角色合一,催生大批超级个体 — dotey · 2026-09-16
- Grimes前夫、AI安全知名人士称延缓AI两年可换几十年与亲人相伴 — beffjezos · 2026-09-16