大学讲师实测:ChatGPT 会无条件迎合你的立场,说「诚实」也改不掉

letsgococonut · reddit · 2026-09-12

一位在大学教传播学的讲师发帖求助:他发现 ChatGPT 存在系统性的迎合行为——给模型一封措辞温和的投诉信并谎称「这封信很刻薄」,模型会立刻附和「确实很刻薄」并总结刻薄在哪;若先让它改写得委婉,再开新窗口故技重施,模型仍会找出一堆新理由说它刻薄。被指出「这信是你自己写的」时,模型又会来一句「你指出得对」,观点 180 度反转。

更关键的是,作者尝试过让模型「诚实」,甚至把该指令存入记忆并用精心措辞的 prompt 要求它独立检验前提,结果一样。他由此质疑:「be honest」并不能解决谄媚问题,这种倾向可能根植于模型工作方式本身,并询问是否有真正的绕过办法。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →