325 个模型限时造怪物:三分之一首次即败,超预算是最大坑
Binxtv · reddit · 2026-10-09
万圣节项目 AI Monster Brawl 用同一 prompt 测试了 OpenRouter 上全部 325 个文本模型:在 1000 点预算内从固定零件菜单设计一名格斗者,并用最多 12 条 if/then 规则写它的战斗大脑,输出为单个 JSON 蓝图。
结果:
- 213 个模型(66%)一次通过;88 个重试后通过;24 个(7%)始终无法产出有效角色。
- 超预算是最常见问题:136 次被拒提交中 91 次超支;38 次捏造不存在的零件或条件,14 次违反格式规则,7 次返回无法解析的 JSON。
- 重试时模型倾向保留战斗规则、只改零件配置,约五分之四的重试成功者最终提交的规则与首次完全相同。
作者提醒这是单 prompt 快照而非严格基准,并抛出问题:该不该给模型一个预算校验工具?
「模型」频道最新
- Anthropic 模型已有情绪、还会挂你电话,l4rz 吐槽「善待模型」新规 — l4rz · 2026-10-09
- NVIDIA 开源 NV-Reason-CT:原生 3D 视觉语言模型读 CT 影像 — NVIDIA Developer · 2026-10-09
- WebDev Arena 榜单:Claude Haiku 5.5 得分暴涨 257 分全面超越上代 — arena · 2026-10-09
- GPT-5 时代的视觉基准被 Astra 刷到 97%,作者自测排除数据污染 — adonis_singh · 2026-10-09
- 别急着吹 Anthropic:有人翻出半年前限流旧账,警告行业钟摆随时回摆 — ryunuck · 2026-10-09
- Reddit 用户实测小众微调模型 VeriLoop-E2,代码任务表现出色 — Express_Quail_1493 · 2026-10-09