星际争霸 Bench 实测:主流大模型打 RTS 全都不敌新手

dotey · x · 2026-09-22

开发者 Ben Swerdlow 做了一个 Brood War Bench,让通用大模型以智能体形式直接操作《星际争霸:母巢之战》,测试它们能否自主建基地、造兵、打仗。结果是所有模型都没超过新手水平。

各模型表现:

核心结论:当前大模型在需要持续观察、快速决策、多线程协调的实时环境中仍远远不够用。这与会玩星际的 AlphaStar 形成对比——后者是专门训练的强化学习 AI,而这次测的是通用模型的智能体能力。

所属事件:《星际争霸》基准测试曝光大模型短板(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →