CivBench 让 LLM 打文明 V:GLM-5.3 胜过 Opus-5.5

vox-deorum · reddit · 2026-10-06

作者团队在其 COLM 2026 工作基础上推出受控版 CivBench,用《文明 V》检验 LLM 的长程策略能力——这种「决策后果要几十上百回合后才显现」的博弈正是传统 benchmark 难以覆盖的。

实验设计:

主要结果:

团队正测试 GPT-6.1-Sol、GPT-6-Astra 等新模型,并征集下一个版本应加入的开源模型建议。项目 Vox Deorum 已开源,可安装后与 LLM 文明对战、观战 AI 互打、甚至和对手聊天或让 LLM 当队友。相关方法与「模型是否会授权核打击」的研究分别发表于 COLM 2026 与 EMNLP 2026。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →