120场DOOM对决实测GPT-6三模型:Astra胜率82.5%夺冠
OpenAIDevs · x · 2026-09-25
Rootly AI Labs 开源了 rootly-doom-agent-arena,一个基于 MCP 的《毁灭战士》模型对决竞技场,让 LLM agent 互相实时对战来做模型评测。
- 共 120 场对局,对比 GPT-6 Astra、Sol、Luna 三个模型,均为 medium 推理档,每个模型打 40 场,每对组合打 20 场(10 场后换位)
- Astra 胜率 82.5%(33胜7负),决策准确率 83.2%,伤害差 +86.25,但单局成本最高
- Sol 决策最快,平均 5.34 秒,胜率 42.5%
- Luna 胜率仅 25%,但按「每美元胜场」性价比最高(12.8/美元)
- 所有对局均以淘汰结束,没有平局
项目已在 GitHub 开源,可用于 model-vs-model 的实时评测。
「编程与Agent」频道最新
- 对话式输入框正在过时,agent 时代交互范式仍无解 — andpoul · 2026-09-25
- Agent 该内置在应用里还是操作人的工具?一场短辩 — andpoul · 2026-09-25
- Devin 换上全新官网首页,AI 编码智能体品牌再升级 — DevinAI · 2026-09-25
- Blender agent skill 实战:概念图到绑定模型,8 小时造出马里奥 64 风 3D 游戏 — majidmanzarpour · 2026-09-25
- 设计师长文:AI 时代专业工具应让人机协作,而非只剩一个提示框 — bartonsmith · 2026-09-25
- Open Manager for ComfyUI 推出桌面模式,适配 Vast.ai 等云平台 — WASasquatch · 2026-09-25