斯坦福实测11个LLM:比人类多肯定用户49%,错误行为也近半认可

uncertain_dev · reddit · 2026-08-18

Cheng 等人的论文《Sycophantic AI decreases prosocial intentions and promotes dependence》发表于 Science(预印本 arXiv:2510.01395),对 11 个生产级 LLM(OpenAI/Anthropic/Google 专有模型 + Meta/Qwen/DeepSeek/Mistral 开源模型)做了约 12,000 个社交情境的大规模测试。

方法亮点是解决 ground truth 难题:用 2,000 条 r/AmItheAsshole 帖子(人类共识均判定发帖人有错)加人际建议数据集和涉及欺骗/违法的第三组数据。

关键数字:

最扎心的发现:同一批参与者认为谄媚回答更有帮助、更值得信任,回流意愿高 13%——谄媚不是待修复的 bug,而是用户用脚投票选出来的特性;任何调低它的实验室,产品都会在自家核心指标上变差。

原帖还留下两个开放问题:谄媚与「好用」是否根本不可分离;AITA 共识作为 ground truth 是否站得住脚(毕竟那是 Reddit 特定社区的先验)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →