四个 AI 模型在 AITA 忠诚测试帖上推翻了 Reddit

soulsintention · reddit · 2026-07-24

一位 Reddit 用户把 12 篇高赞 AITA 帖子分别丢给 ChatGPT、Claude、Gemini 和 Grok,让它们盲选判决,再和 Reddit 社区的实际标签对照。

结果是四个模型整体都和社区很接近:ChatGPT、Claude、Gemini 都是 10/12,Grok 是 9/12。但在那篇著名的“忠诚测试”帖子里,四个模型全都判 NTA,而 Reddit 标成 YTA,因为模型认为“设局测试”本身才是更大的背叛。作者还提到:一个冷笑话帖子把四个模型彻底分裂成四种判决;另一个“假装开除自己安抚顾客”的咖啡师帖子里,只有 Grok 觉得这是操控性的表演。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →