7个LLM大战210局狼人杀:GPT-5社会推理Elo榜首

RaphaelDabadie · x · 2026-08-30

作者一年前发布的 Werewolf Benchmark 已产出首批结果:让 7 个最强开源/闭源 LLM 作为带工具调用的 agent,进行 210 局狼人杀对局,测试语言对抗场景下的社会智能——实时适应、长上下文管理、结盟、操纵与反操纵。

结果以 角色条件 Elo 排行榜 呈现(区分狼人 Elo 与村民 Elo):GPT-5 明显领跑,GPT-OSS 垫底(但作者强调入选模型本身都已是狼人杀高手)。项目还引入社会策略指标:自爆率、首日狼人出局率、狼方操纵成功率,以及逐消息的投票摇摆监测用于说服力分析。设计基于 Google Research 的 Werewolf Arena 论文并做了扩展(市长选举与发言顺序协议、角色平衡的系列赛等)。团队正在招募有实力挑战 GPT-5 的模型加入。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →