用《星际争霸:母巢之战》测模型:Codex Astra 100% 胜率登顶
steipete · x · 2026-09-21
开发者 Ben Swerdlow 打造了只能通过 agent 游玩的《Brood War》版本,并以此为基准测试各家模型(Brood War Bench)。核心发现:
- 没有一个模型玩出新手以上水平,Codex Astra(xhigh)以 18 胜 0 负、100% 胜率居首,各配置 Codex Astra 包揽前四中三席
- Grok 4.6 几乎不会玩:三个配置合计仅 3 胜,胜率最低至 0%
- 老模型把 RTS 玩成回合制:思考期间部队静止挨打;新模型仍会掉进同一陷阱,这解释了为何部分低推理档位反而表现更好
- Codex 的强项是「cheese」式骚扰而非宏观运营;Claude Fable 以 83.3% 胜率列第三
- 榜单同时记录每局成本($0.16–$21.07)与 APM
「模型」频道最新
- Burkov 锐评神秘项目 Jev:号称秒杀 LLM,结论是 BS — burkov · 2026-09-21
- 曝月之暗面与腾讯混元竞逐 Flash 小模型,主攻 Agent 推理成本 — TheZachMueller · 2026-09-21
- 开发者上线 Made With Jev 目录站,汇总模型演示、工具与 Skills 资源 — Sea_Supermarket_5891 · 2026-09-21
- 逆向工程该选哪个模型?开发者求助 Ghidra/IDA 的 MCP 工作流 — obese_coder · 2026-09-21
- JEV「不会幻觉」存疑:同提示多次运行概率不一、选项顺序显著影响输出 — FrankFelixAI · 2026-09-21
- Reddit 用户发现直接调用 Jev 需排候补名单,疑因上周热度爆棚 — Creative-Drawer2565 · 2026-09-21