实测:ChatGPT、Claude、Gemini群聊互查,揪出彼此幻觉

capibara13 · reddit · 2026-08-24

作者将ChatGPT、Claude和Gemini拉入群聊解决复杂问题,观察它们互相审查。结果:ChatGPT给出结构完美但完全错误的答案(幻觉了不存在的税务规则);Claude立即指出错误但过度修正导致数学错误;Gemini作为最终裁判,结合前两者优点给出完美答案。结论:让AI自我审查如同学生自批作业,不同模型互相检查能暴露盲点。作者因此建立了网站让模型实时辩论。

所属事件:多模型互查系统有效揪出AI幻觉(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →