PokeBench:给前沿 LLM 1000 回合挑战宝可梦红首个道馆
VibeCodyH · reddit · 2026-09-26
PokeBench 给每个模型完全相同的条件:Game Boy 屏幕、11 个按键、可通行网格和 1000 回合,要求打败小刚,无攻略、无寻路、无提示,统一 prompt。评分采用 10 级里程碑阶梯(出门、选御三家、到达 1 号道路……击败小刚),未通关也能按进度排名。
- 目前 14 次运行中 4 次拿到徽章
- 最佳成绩:GPT-6 Astra 用 246 回合通关
- 最便宜的通关:Gemini 3.8 Flash,仅花 $3.70
- 本地免费模型 Muse Glimmer 30B 烧完 1000 回合,止步「到达 1 号道路」
完整的逐回合日志、成本和录像都在 pokebench.tv 公开。
「模型」频道最新
- Yoav Goldberg 发现模型擅解推箱子类游戏,疑训练数据所致 — yoavgo · 2026-09-26
- Opus 5.5 高推理档位跑 20 分钟零反馈,用户吐槽没法判断进度 — rms80 · 2026-09-26
- OpenAI 研究员谈 RL 泛化:arXiv 引理任务或能检验推理泛化能力 — lukaszkaiser · 2026-09-26
- 开源 Kev 决策模型家族:0.8B 到 27B 可本地免费跑分类 — alexcovo_eth · 2026-09-26
- Tev1 0.8B 开源:Mac 本地跑 Jev 式分类器,延迟仅约 50ms — iamrobotbear · 2026-09-26
- Delip Rao:现有 LLM 微调的判定模型难带来真正的评委多样性 — deliprao · 2026-09-26