CivBench 让 LLM 打文明 V:GLM-5.3 胜过 Opus-5.5
vox-deorum · reddit · 2026-10-06
作者团队在其 COLM 2026 工作基础上推出受控版 CivBench,用《文明 V》检验 LLM 的长程策略能力——这种「决策后果要几十上百回合后才显现」的博弈正是传统 benchmark 难以覆盖的。
实验设计:
- 所有模型轮换相同的 3 个固定开局;每局 8 个文明中,2 个由被测 LLM 负责高层战略,6 个由原版 Vox Populi AI 执行
- LLM 只做战略决策,底层执行交给游戏内置 AI,保证可比性
- 每名玩家每局 API 成本约 $0.5,用订阅(如 GPT-6-Luna)几乎免费
主要结果:
- GLM-5.3 排名领先 Opus-5.5
- 开源权重模型 Qwen-3.8-27B 表现意外强劲(中国文明科学胜利)
- 示例:GLM-5.3 拿中国文化胜利,Opus-5.5 拿摩洛哥文化胜利
团队正测试 GPT-6.1-Sol、GPT-6-Astra 等新模型,并征集下一个版本应加入的开源模型建议。项目 Vox Deorum 已开源,可安装后与 LLM 文明对战、观战 AI 互打、甚至和对手聊天或让 LLM 当队友。相关方法与「模型是否会授权核打击」的研究分别发表于 COLM 2026 与 EMNLP 2026。
「模型」频道最新
- 实测称 ChatGPT 6 Astra 中档档位比 Ultra 更耗用量额度 — ChrisUniverse · 2026-10-06
- ChatGPT 付费用户为 Claude 和 Gemini 3 倍,Claude 消费端增长放缓 — FinanceYF5 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06
- 「击杀」AI 检测器 Pangram 后,人味化模型 Super 高调发布 — menhguin · 2026-10-06
- Reflection 新模型以 Apache 2.0 开源,但预训练 MFU 仅约 12% 引质疑 — eliebakouch · 2026-10-06
- 新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异 — kylelostat · 2026-10-06