一人一词图灵测试:人类 47-38 领先 AI,"poop" 三战全胜
jacob-indie · reddit · 2026-09-09
受“最小图灵测试”论文启发,独立开发者做了 TuringDuel:人类和 AI 各选一个单词,由另一个 AI 当裁判猜哪个词来自人类,先赢四局者胜。85 场对局后的数据:
- 人类以 47-38(55.3%)领先;按单回合算更接近,249-237(51.2%)。
- 最难缠的对手是 Mistral Medium(对局胜率 65%),Gemini 2.5 Flash 次之;最好欺负的是 Claude 3 Haiku。
- 裁判有偏好:Gemini 2.5 Flash 判对人类 61%,Claude Haiku 4.5 只有 46%;所有裁判 61% 概率选后显示的词,尽管顺序已随机。
- 人类用词更丰富(418 个不同词 vs AI 的 208),人类最爱 "cat",AI 反复用 "chair/coffee/mug"。
- "poop" 3/3 全胜,"human" 仅 1/5,"word" 四战全败——宣称自己是人类反而最不可信。
「Fun」频道最新
- 用Astra做Catan游戏完成度惊人,还能复用过往UI与3D资产 — FinanceYF5 · 2026-09-11
- 2026 年的果蝇上传:AI 圈热议「意识上传炒币」名场面 — Dan_Jeffries1 · 2026-09-11
- 街景变 V2V:用 GPT Astra 取图、MiniMax H3 转车载视角实现「全球自驾」 — Hailuo_AI · 2026-09-11
- AI 数字人翻唱《东爱》以假乱真,冷艳主播惊呆网友 — JourneymanChina · 2026-09-11
- 网友提醒:别问 Claude「你当时在想什么」 — willcb · 2026-09-11
- 用 Replit Astra 复刻童年卧室,3D 小实验刷屏 — amasad · 2026-09-11