RSIGame 递归自我改进训练 Agent,Qwen-27B 超越 GPT-5.5 且省 11 倍 token
RSIGame · hf · 2026-10-01
RSIGame 是一个带递归自我改进的自主游戏开发 Agent 框架,解决朴素迭代精炼容易过拟合少量测试用例的问题。框架分两层:局部「探索-诊断-改进」循环广泛探索可执行游戏、按证据排序修复问题,并由持续积累测试与改进指南的演进清单支撑;全局循环追踪整体质量、保留最佳检查点、检测饱和与回退。此外还通过训练把成功的开发经验内化进生成器。
在 140 个 GameCraft-Bench 任务、两个游戏引擎和五个生成器上,RSIGame 在同等开发预算下持续提升游戏质量。经验内化使 Qwen3.8-27B 在 Godot 上达 61.38、Phaser 上达 58.53,超过 GPT-5.5 的一次生成成绩,同时生成 token 减少 11 倍。
「编程与Agent」频道最新
- codemode 结合通用分类模型的 pi 演示获开发者圈好评 — ricklamers · 2026-10-01
- 前 Cursor 工程师跑 6 个 Grok Bot:从提示词到雇一队 Agent 的工作流 — lasas · 2026-10-01
- 开发者做 Agent 定制乐高套装:AI 设计后直接下单,即将发布 — noahsolomon · 2026-10-01
- 把付费外包活交给 AI Agent 一个月:验证而非智能才是关键 — alexksteadman · 2026-10-01
- Meta 研究员坦承:维护良好的 monorepo 是运营 AI 实验室的最佳方式 — soldni · 2026-10-01
- 一个 uv 替代五个 Python 工具,比 pip 快 10-100 倍 — blaizedsouza · 2026-10-01