RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
Shuai Bai, Jiayong Deng, Yikun Fu, Chang Gao, Xuhao Hu, Mianqiu Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Keliang Li, Ning Li, Wanli Li, Dayiheng Liu, Dunjie Lu, Changwei Luo, Que Shen, Zheyuan Wang, Zijian Wang, Jie Wu, Gao Wu, Zhihui Xie, Rui Xie, Haiyang Xu, An Yang, Jiakang Yuan, Yanming Zhang, Jiajun Zhang, Xi Zhang, Zhenru Zhang, Zhuo Zhen, Mingkang Zhu, Bowen Zhou
cs.CL, cs.SE
2026-09-19
五平台应用复现基准RecreationBench共250题。GPT-6 Astra总分58.1%,程序断言全过只有2.8%;静态界面好过,交互和计算输出更差,复现代码量中位只有参考的16.9%。
Computer-use agent 长期分成两路:一路点图形界面,一路在终端里写代码。真活是交错的。看懂一个系统要去点,改它要写代码,跑起来再看界面,发现不对再改。现有基准往往只测其中一种模态,GUI 和编程被当成两段流水线,而不是同一条长程里的自主切换。
阿里 Qwen 组把这件事收成一项任务:recreation。给你一个正在跑的参考应用,不给(或尽量不给)源码,自己摸行为、自己实现、自己编译启动、自己对着参考验。参考同时是规格说明书和自动打分的预言机。
RecreationWorld 在 Ubuntu、macOS、Windows、Android、Web 上提供可复现环境,统一 harness 同时暴露原生 GUI 控制和编码工具。桌面和 Android 尽量源码不可见,只给可执行界面;Web 做不到同等盲源,因为静态站点的客户端就是服务器下发的东西,于是改保测试套件和真值。提交物按平台走:桌面要能构建启动,Android 交 Gradle 出 APK,Web 交自包含 index.html。评的是可观察行为,不评是否抄了参考架构。
隐藏测试从参考上长出来。程序断言走各平台无障碍/自动化接口读精确文本和控件状态;视觉断言看布局、颜色、画布。每条都要先在参考上跑通,再经人工复核,然后冻结。套件平均约 77% 的用例会离开起始界面,94.2% 检查交互结果而不是元素在不在。单次 rollout 墙钟上限 20 小时。
训练从高质量开源 GUI 应用滚轨迹,按行为验证器做拒绝采样,五平台各留 7000 条,共 35000 条 SFT,用来微调 Qwen3.7-Plus 和一版 Qwen-Flash 续预训练检查点。评测集 RecreationBench 共 250 题,每平台 50 个应用。
十个前沿模型里 GPT-6 Astra 总分 58.1%(精确值 58.06%),其后 Claude Opus 5 为 44.16%、GPT-5.6 Sol 为 42.06%。Astra 是唯一在多个平台上拿到整套程序断言全过的模型,但全过只覆盖 2.8% 的题;其他模型最多 0.8%。90% 程序分覆盖率 Astra 17.6%,Opus 5 只有 5.5%。
轨迹中位数 282.5 次顶层工具调用,每 100 次调用有 9.08 次 GUI–改代码切换,比 WeaveBench 更长、切得更勤。多数模型在轨迹中点之前已经写出最终源码的一半以上,典型路径是先搭大骨架再小改。严格的收尾循环(最后一次改源码、重新启动候选、再观察自己的界面)最高也只有 47.5%,Astra 为 29.1%。
交出来的应用更小、更挤:相对参考,89.4% 的复现 LOC 更少,中位比例 16.9%;92.3% 文件数更少,83.8% 把更大份额塞进单个最大文件。静态界面结构比交互和计算输出好过。训练过 recreation 的两个检查点在五个分布外的编程和混合 computer-use 基准上都高于各自的第一检查点,最大升幅 17.9 个百分点,后期更常去看自己渲染出来的图。
| 模型 | 总分 | 程序套件全过 |
| GPT-6 Astra | 58.1% | 2.8% |
| Claude Opus 5 | 44.16% | ≤0.8% |
| GPT-5.6 Sol | 42.06% | ≤0.8% |
Windows 上把 GUI 原语换成持久 Node REPL 的对照里,Claude Opus 4.8 任务质量接近,墙钟从 4.12 小时降到 3.04,估计费用从 90.50 美元降到 41.58 美元。这是整套配置对比,不是单独因果。
这是目前最接近「又会点又会写、还要用运行结果打自己」的混合 CUA 环境。隐藏测试从可执行参考长出,不规定候选用什么框架,适合做可验证的自我改进数据。对做 agent 产品的人,58 分的总分不能读成「能复现应用」:全程序套件通过率只有 2.8%,静态壳比交互逻辑好做得多。训练信号可以往分布外的编程和 computer-use 上搬,recreation 不只是一道偏题。
基准钉死可复现环境,不含在线服务、外部状态变化和真实多用户。隐藏套件只覆盖有限状态和路径,过套件不等于行为等价。公开参考可能进过预训练,源码重叠筛查挡不住记忆。Android 还没有包级出站过滤,已安装的参考包原则上有被还原的残余风险。Web 的源码边界最松。轨迹分析把模型、harness、运行时绑在一起,不能把「探索更广」因果地写成「所以分高」。GUI 视觉分由 Qwen3.7-Plus 做零温二分类,裁判偏差会进 VLM 通道。