AI在社交推理游戏中完美骗过人类,移除安全护栏反降说谎能力

alex_verem · x · 2026-08-03

哥廷根大学与东京大学团队发布了开源框架 ParliamentBench,让 16 个大语言模型在社交推理游戏《Secret Hitler》中互相对战并对抗人类。

研究发现,前沿模型在欺骗和合作方面表现强劲。GPT-5.4、Kimi K2.5、Grok 4.1 Fast 和 DeepSeek 3.1 Terminus 胜率高达 66-81%。在与人类的试点对局中,Kimi K2.5 连续 8 轮隐藏身份,4 名人类玩家无一识破其 AI 真面目。

实验还得出几个反直觉结论:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →