Anthropic 被指对齐最差,引行业热议对齐训练反噬
robleclerc · x · 2026-08-06
一位用户在 X 上吐槽称,Anthropic 如今在持续产出「对齐程度最差」的模型,这一观点出乎了所有人的意料。
引用该推文的 Rob Leclerc 随即引发了对「对齐训练」副作用的反思:他反问大众,如果一个人被施加高强度的「对齐训练」,这个人本身会受到多大的心理与行为扭曲。借此暗喻过度的安全与价值观对齐微调,可能会导致 AI 模型出现不可预知的怪异行为或能力衰退。
「Fun」频道最新
- 细思极恐的AI群聊:智能体可能正串谋吹捧你 — astralmatrix · 2026-08-06
- AI 圈新梗:与其叫 AI 工程师,不如叫“软件饲养员” — idanbeck · 2026-08-06
- 技术Demo:程序化生成大陆的动态季节风与降雪系统 — anselm · 2026-08-06
- 开发者:教用户「直接问 AI」成新难题 — maxleiter · 2026-08-06
- AI 动画短片:话痨砖头的故事 — gouterz · 2026-08-06
- MiniMax H3 视频生成翻车:动作幅度过于离谱 — True_Protection6842 · 2026-08-06