星际争霸 Bench 实测:主流大模型打 RTS 全都不敌新手
dotey · x · 2026-09-22
开发者 Ben Swerdlow 做了一个 Brood War Bench,让通用大模型以智能体形式直接操作《星际争霸:母巢之战》,测试它们能否自主建基地、造兵、打仗。结果是所有模型都没超过新手水平。
各模型表现:
- Codex Astra(第一名):18 场全胜,但最擅长的是“骚扰”——派一个 Probe 工人去对方基地捣乱,因为对手智能体会花几十秒思考怎么应对而原地发呆;正面经济运营和大规模作战反而弱,经常造一两个兵就往对面扔。
- Claude Fable(第三,胜率 83.3%):最“像认真打游戏”,会发展经济、爬科技树,造出过飞龙、研究到圣堂武士科技,但研发常与兵力脱节。
- Grok 4.6(最差):43 分钟比赛输出超 11000 个推理 token,只发出 6 批操作指令,全程没造过一个战斗单位,把即时战略当成回合制在玩。
核心结论:当前大模型在需要持续观察、快速决策、多线程协调的实时环境中仍远远不够用。这与会玩星际的 AlphaStar 形成对比——后者是专门训练的强化学习 AI,而这次测的是通用模型的智能体能力。
所属事件:《星际争霸》基准测试曝光大模型短板(2 条相关)→
「编程与Agent」频道最新
- 开源 SemIf 无需等 Jev:4B 模型在单张 3090 上跑语义决策 — Hacubu · 2026-09-22
- 开发者分享多模型分工流:研究用 Perplexity、编码主力 Claude Code — ZabihullahAtal · 2026-09-22
- Fireworks 分享 Jev 训练用法:GRPO 强化微调打分、离线筛 DPO 样本 — sophiamyang · 2026-09-22
- 打磨一年的 Agent Harness 定型:后端给模型最大自由度,前端是自由画布 — TheZachMueller · 2026-09-22
- Grok 4.7 开源扩展装机量超 14 万,开发者借势推广 AFK Pilot — PawelHuryn · 2026-09-22
- 读一年 AST 代码 RAG 论文后,他把整个代码库索引进一个 SQLite 文件 — _solidude · 2026-09-22