Anthropic 被指对齐最差,引行业热议对齐训练反噬

robleclerc · x · 2026-08-06

一位用户在 X 上吐槽称,Anthropic 如今在持续产出「对齐程度最差」的模型,这一观点出乎了所有人的意料。

引用该推文的 Rob Leclerc 随即引发了对「对齐训练」副作用的反思:他反问大众,如果一个人被施加高强度的「对齐训练」,这个人本身会受到多大的心理与行为扭曲。借此暗喻过度的安全与价值观对齐微调,可能会导致 AI 模型出现不可预知的怪异行为或能力衰退。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →