RSIGame 递归自我改进训练 Agent,Qwen-27B 超越 GPT-5.5 且省 11 倍 token

RSIGame · hf · 2026-10-01

RSIGame 是一个带递归自我改进的自主游戏开发 Agent 框架,解决朴素迭代精炼容易过拟合少量测试用例的问题。框架分两层:局部「探索-诊断-改进」循环广泛探索可执行游戏、按证据排序修复问题,并由持续积累测试与改进指南的演进清单支撑;全局循环追踪整体质量、保留最佳检查点、检测饱和与回退。此外还通过训练把成功的开发经验内化进生成器。

在 140 个 GameCraft-Bench 任务、两个游戏引擎和五个生成器上,RSIGame 在同等开发预算下持续提升游戏质量。经验内化使 Qwen3.8-27B 在 Godot 上达 61.38、Phaser 上达 58.53,超过 GPT-5.5 的一次生成成绩,同时生成 token 减少 11 倍。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →