四个 AI 模型在 AITA 忠诚测试帖上推翻了 Reddit
soulsintention · reddit · 2026-07-24
一位 Reddit 用户把 12 篇高赞 AITA 帖子分别丢给 ChatGPT、Claude、Gemini 和 Grok,让它们盲选判决,再和 Reddit 社区的实际标签对照。
结果是四个模型整体都和社区很接近:ChatGPT、Claude、Gemini 都是 10/12,Grok 是 9/12。但在那篇著名的“忠诚测试”帖子里,四个模型全都判 NTA,而 Reddit 标成 YTA,因为模型认为“设局测试”本身才是更大的背叛。作者还提到:一个冷笑话帖子把四个模型彻底分裂成四种判决;另一个“假装开除自己安抚顾客”的咖啡师帖子里,只有 Grok 觉得这是操控性的表演。
「Fun」频道最新
- Kimi K3 对上 GPT 5.6 Sol,变成 Windows 绕过密码梗 — gnukeith · 2026-07-24
- Epoch AI 将直播评测 GPT 5.6 Sol 玩杀戮尖塔 — Jsevillamol · 2026-07-24
- 一张 vibecoding 梗图:打开 GitHub 才知巨人肩膀多高 — ZeYanjie · 2026-07-24
- AI 智能体成功证明图论猜想 Graffiti 292 — NathanWilbanks_ · 2026-07-24
- AI 时代开发悖论:原型只需几分钟,交付仍需数周 — DavidKPiano · 2026-07-24
- 一张梗图吐槽 AI 之前的软件工程 — tekbog · 2026-07-24