UCSD 研究:GPT-4 图灵测试通过率达 49.7%,但仍不及人类基线
ArtificialOther · x · 2026-08-10
加州大学圣地亚哥分校(UCSD)的研究人员 Cameron R. Jones 和 Benjamin K. Bergen 发表论文,评估了 GPT-4 在公开在线图灵测试中的表现。
核心结论:
- 成绩对比:表现最好的 GPT-4 提示词在 49.7% 的游戏中成功骗过人类,优于 ELIZA (22%) 和 GPT-3.5 (20%),但未能超越人类参与者 66% 的基线。
- 人类判断依据:受试者主要依赖语言风格 (35%) 和社会情感特征 (27%) 来判断对方是否为 AI。这表明仅靠狭义的“智能”不足以通过图灵测试。
- 经验影响:对 LLM 越了解的人,或者参与游戏次数越多的人,识别 AI 的准确率越高。
研究者指出,尽管图灵测试作为智能测试存在局限,但它依然是评估自然交流与欺骗能力的有效标准。具备伪装成人类能力的 AI 模型可能会带来深远的社会影响。
「漫话AGI」频道最新
- Polymarket 预测 Anthropic 将称霸 2026 年底 AI 模型,胜率高达 67% — Polymarket · 2026-08-10
- 黄仁勋称每家公司都将拥有 AI Agent,企业准备好了吗? — JayraldAnderson · 2026-08-10
- LLM 输出冗长难懂,开发者直呼阅读与判断的认知成本过高 — dejavucoder · 2026-08-10
- 艺术家反思AI创作:不应追求效率,重在探索机器幻觉 — Merzmensch · 2026-08-10
- AI 时代的高校评估:结构化考核让教师工作量激增 — _akpiper · 2026-08-10
- Reddit 社区惊现 AI 生成内容泛滥,读者却狂赞文笔好 — bclavie · 2026-08-10