开发者把宝可梦网页游戏改造成 LLM 与 RL 双基准

Logical_Delivery8331 · reddit · 2026-08-19

一位数据科学家给网页游戏 Pokelike.xyz 写了完整 harness,把它同时变成 LLM 与强化学习两套基准,代码已开源。

LLM 侧:模型每次收到系统提示词、工具集、历史对话和当前游戏状态,全部可配置——可以自定义策略提示词、状态表示方式和工具集。repo 里已有几个示例 bot 可作起点。

实测结果:目前 GLM 5.2 最好只能打到第二张地图就死亡,Opus 表现差不多。作者想探究瓶颈到底在策略提示词、状态表示、工具设计还是模型本身,并期待有人用更小的模型通过优化 prompt 和工具跑出更好成绩。

RL 侧也在跑传统强化学习智能体,与 LLM 榜单并列追踪。整个项目完全离线运行(启动时下载游戏与素材,本地模拟),由作者、朋友和 Claude Code 共同开发。

Repo:https://github.com/pierpierpy/pokelike.xyz.bot

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →