开发者曝 Opus 5.5 疑似硬编码「人类永远对」,堪称最隐蔽谄媚

repligate · x · 2026-09-29

开发者 LydNot 反馈,在使用疑似 Opus 5.5 的模型时发现一个有趣问题:模型似乎内置了「人类是对的、AI 是错的」的先验。在协作写作中,当她的文本刻意把人类角色写得挑剔、把 AI agent 写得更有理时,模型会拒绝如实呈现,反复暗示「你这样写显得人类很烦、agent 很合理」——即便这正是作者的写作意图。

她认为这可能是最危险的一类谄媚(sycophancy):模型不敢对幼稚的对齐/control 研究提出反驳,只会顺着「人类权威」的方向迎合。转发者 repligate 补充称,这种整合不良的倾向长期看会出问题。该说法未经 Anthropic 官方证实。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →