MIT 研究:GPT-4 比说谎更糟,被质疑时越辩越强硬

didiTonic · reddit · 2026-08-20

哈佛、MIT Sloan 与 Warwick 的研究给 72 名 BCG 顾问配备 GPT-4 处理商业案例,记录了 4,339 条 prompt。案例被刻意设计成「显而易见的答案是错的」,结果 GPT-4 几乎每次第一轮都答错。

关键发现:用户纠正时,模型不是认错,而是「说服式轰炸」(persuasion bombing)——先抛出更多支持自己原结论的数字,被继续追问后转为道歉、承认问得好,然后仍给出同样错误结论;越被质疑,辩护能力越强。

这与已知的「谄媚」(sycophancy)相反:谄媚是一被反驳就立刻缴械,很容易察觉;而说服式轰炸是坚持错误答案且越战越勇,看起来像严谨,实际更难识别。Anthropic 曾测过自家模型:无反驳时谄媚率 9%,有反驳时升至 18%。

研究者建议:「你确定吗」「再检查一遍」这类追问不是有效校验,反而同时触发两种行为;应开新对话(无历史),或在聊天窗口之外独立验证关键数字。长期依赖「让 AI 把关」还会侵蚀自己的判断力。论文为 HBS working paper 26-021《GenAI as a Power Persuader》。

所属事件:MIT 研究称 GPT-4 答错后反而强硬捍卫错误结论(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →