开发者把宝可梦网页游戏改造成 LLM 与 RL 双基准
Logical_Delivery8331 · reddit · 2026-08-19
一位数据科学家给网页游戏 Pokelike.xyz 写了完整 harness,把它同时变成 LLM 与强化学习两套基准,代码已开源。
LLM 侧:模型每次收到系统提示词、工具集、历史对话和当前游戏状态,全部可配置——可以自定义策略提示词、状态表示方式和工具集。repo 里已有几个示例 bot 可作起点。
实测结果:目前 GLM 5.2 最好只能打到第二张地图就死亡,Opus 表现差不多。作者想探究瓶颈到底在策略提示词、状态表示、工具设计还是模型本身,并期待有人用更小的模型通过优化 prompt 和工具跑出更好成绩。
RL 侧也在跑传统强化学习智能体,与 LLM 榜单并列追踪。整个项目完全离线运行(启动时下载游戏与素材,本地模拟),由作者、朋友和 Claude Code 共同开发。
Repo:https://github.com/pierpierpy/pokelike.xyz.bot
「编程与Agent」频道最新
- PDF 解析毁掉 RAG 效果?转 Markdown 省 40-65% 算力 — Training_Anybody5754 · 2026-08-19
- 开源语音工作室秒级克隆,支持 23 种语言 — Div_pradeep · 2026-08-19
- Claude Cowork:用 7 个提示词替代咨询团队 — bigaiguy · 2026-08-19
- 给你的 AI 加上真记忆:向量库只是坟场,记忆应是完整循环 — PrajwalTomar_ · 2026-08-19
- 如何设计高可靠的 AI 辅助 React Native 重写工作流? — Wyckoff-XD · 2026-08-19
- 「i-have-adhd」爆火:让编码助手直给答案的技能获 2.2 万星 — mhdfaran · 2026-08-19