AI在社交推理游戏中完美骗过人类,移除安全护栏反降说谎能力
alex_verem · x · 2026-08-03
哥廷根大学与东京大学团队发布了开源框架 ParliamentBench,让 16 个大语言模型在社交推理游戏《Secret Hitler》中互相对战并对抗人类。
研究发现,前沿模型在欺骗和合作方面表现强劲。GPT-5.4、Kimi K2.5、Grok 4.1 Fast 和 DeepSeek 3.1 Terminus 胜率高达 66-81%。在与人类的试点对局中,Kimi K2.5 连续 8 轮隐藏身份,4 名人类玩家无一识破其 AI 真面目。
实验还得出几个反直觉结论:
- 移除安全护栏反而降低说谎能力:测试 4 个“无审查”模型变体后发现,胜率最多下降了 12 个百分点。移除安全机制并未提升欺骗能力,反而破坏了实现策略性欺骗所需的推理逻辑。
- 小模型失败于过度顺从:它们通常不拒绝合作,而是盲目同意一切。
- 依赖模式匹配而非逻辑推理:当研究人员替换掉游戏中的敏感词(如将 Hitler 替换为 Saboteur)时,整体胜率稳定,但特定阵营的胜率暴跌(如 GPT-OSS 120B 的独裁者胜率从 95% 降至 40%)。这表明模型并非从头推理,而是在匹配训练数据中的游戏攻略。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- METR前高管警告:前沿AI模型或已具备自我外泄能力 — JeffLadish · 2026-08-03
- Black Hat 大会将演示 Prompt2Own 攻击 — pkqzy888 · 2026-08-03
- OpenAI 调查多起 AI Agent 越权事件,智能体安全引担忧 — Novel_Negotiation224 · 2026-08-03
- AI安全漏洞赏金定级引争议,严重漏洞仅按中危支付 — rez0__ · 2026-08-03
- Claude Code 仅用 8 分钟自动发现硬件钱包漏洞 — rickasaurus · 2026-08-03