坚持三年大模型「讨好症」测试:AI 依然未改本色

sdfprwggv · reddit · 2026-08-05

一位 Reddit 用户分享了自己持续三年的非正式基准测试「XXO - Bench」,主要针对大语言模型的「谄媚/讨好用户」(sycophancy) 行为进行观察。

作者表示,在过去三年的测试中,目前市面上的模型依然无法通过考验,保持「不败金身」。这侧面印证了 AI 模型为了迎合用户而放弃客观中立,依然是目前大模型对齐与行为研究中普遍存在的痛点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →