Brood War 基准出炉:Codex 会玩阴招,Grok 太笨上不了场
Kangwook_Lee · x · 2026-09-22
作者 benswerd 上周发布了 Brood War Bench,让各家编程 Agent 实时对战《星际争霸:母巢之战》,并持续更新战况。Kangwook Lee 转发称自己"一夜之间成了评测专家"。
目前的核心发现:
- Agent 距离能正面团灭人族还差得远
- Codex 的打法是走"偷袭/cheese"路线,靠出其不意搞乱对手
- Grok 目前还太笨,玩不了这游戏
- 附带的片段显示 Opus 击败了科技攀得太慢的 Fable
所属事件:星际争霸基准测试:Codex 全胜登顶,主流模型不敌新手(3 条相关)→
「编程与Agent」频道最新
- 「2030 年所有主流软件都将被形式化验证」引发激辩:遗留债务是最大障碍 — luislamb · 2026-09-22
- 开源电脑协手 OpenMuse:一次性 Linux 桌面里替你浏览操作网页 — aniketmaurya · 2026-09-22
- 实测 16/16 vs 9/16:作者提醒警惕 benchmark,用自己数据测 — tobowers · 2026-09-22
- 接入新 LLM 供应商前要检查哪些项?工程师团队的经验清单 — Rama_Surasani_ · 2026-09-22
- 开发者亲历:AI 写产品开发快到让人难以置信 — omnivaughn · 2026-09-22
- OpenAI 案例:V7 用 Context Graph 给企业 Agent 装上长期记忆 — xiaohu · 2026-09-22