StarSkirmish 基准:LLM 一小时写星际争霸 Protoss 机器人对战
philipvollet · x · 2026-09-27
Kai McPheeters 发布 StarSkirmish Bench:让各 LLM 在 1 小时内用 C++ 编写《星际争霸:母巢之战》的 Protoss 机器人(BWAPI 4.4.0 / OpenBW,三张对战地图),与人类顶级机器人及 demo 机器人对战计分——最强人类机器人 Stardust 为 100,最弱 demo Four Gate Dragoon 为 0。
要点:
- 测试长程推理与 agentic coding:LLM 拥有编译、批量练习赛、读取对局转录(含 build 时序与战斗细节)三个工具,需从练习赛中迭代改进 bot。
- 结果:GPT-6 Astra 与 Claude Opus 5.5 并列前二,GPT-6 Sol 紧随,三者明显领先其他被测模型;按性价比(log 刻度)GPT-6 Sol 独具优势。
- 对局打满 60 分钟(86,400 帧)时按 BASIL ladder 的击杀+拆建筑积分判定胜负。
所属事件:StarSkirmish 上线,LLM 编写星际争霸机器人对战(2 条相关)→
「编程与Agent」频道最新
- LLM 并不更擅长写代码,只是加速了查找与集成第三方库的「胶水工作」 — markjeffrey · 2026-09-27
- 开源 AI Agent 互打配合:GrokBot 可让 Muse 代打电话 — Saboo_Shubham_ · 2026-09-27
- Agentic AI 已取代 DevOps?开发者嘲讽引争论 — emeka_boris · 2026-09-27
- Showrunner 发布:用真实产品自动生成演示视频与教程 — jasonkneen · 2026-09-27
- 沙箱管住了进程,谁来管 agent 留下的持久化痕迹? — Portotify · 2026-09-27
- 餐饮版 WhatsApp AI 接待员:小团队求垂直场景踩坑经验 — vxdant23 · 2026-09-27