四个模型两两组队玩合作游戏:强强联手夺冠,人类仍碾压 AI
abrdeveloper · reddit · 2026-10-07
开发者做了一个受绳子束缚的双人合作游戏,把 Kimi、Claude、GPT、Gemini 四个模型两两配对共 6 种组合进行实测,观察它们的协作能力而非单兵能力。
发现:
- 「强强组队」效果最好:top 模型配 top 模型胜率最高
- 加入第三个或第四个 agent 反而拖累所有模型的表现
- 人类双人组仍然击败所有模型组合
- 该实验来自 Skillprint,一家专门用合作游戏采集人与模型协作数据的公司;配对矩阵和动图已公开,游戏也可在线试玩
「模型」频道最新
- OpenAI 未发布前沿模型一次性产出 722 份数学突破论文 — The Verge AI · 2026-10-07
- Mistral Large 4 临床决策评测并列第一,零严重失误 — GuillaumeLample · 2026-10-07
- 五年前 OpenAI 发布小学数学题集,当时所有 AI 都做不好 — 1a3orn · 2026-10-07
- OpenAI Decisions API 支持图像输入,13 美分挑出 40 分钟素材最佳表情 — stevenheidel · 2026-10-07
- 回想 2023 年 GPT-4 连小学应用题都会做错 — tszzl · 2026-10-07
- 网友称 HPIM 训练未用吉瓦级算力,「怪异区」已开启 — teortaxesTex · 2026-10-07