单步界面像真的,GUI世界模型离线任务进度最高只到16.7

GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments

Lin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei, Guo Gan, Boxu Liu, Yilun Zhao, Yu Rong

EMNLP 26 Findings

cs.CL, cs.AI

2026-08-30

GUI-CC用500条离线轨迹和200条在线任务评测世界模型当环境用的上下文一致性,最好模型离线任务进度只有16.7。

这篇在解决什么

GUI 世界模型的卖点是替真实设备当环境:给当前界面和一次动作,生成下一屏,让 agent 在合成界面上多步 rollout,省掉真机重置成本。现有评测几乎都停在单步:下一屏看起来像不像、语义对不对。真正当环境用时,生成的界面会立刻变成下一步的输入。App 身份、导航栈、刚打进去的搜索词、收藏过的条目,都得在后续步骤里还在。

这篇把这个要求叫 contextual consistency,上下文一致性。缺了它,模型可以一直产出「看起来能点」的界面,同时悄悄换了 App、忘了刚保存的状态,或者 launcher 上目标 App 消失。那种 rollout 对训练和评测都是废的。

方法

GUI-CC 两条赛道共用自回归 rollout,动作从哪来不同。

离线参考动作赛道从 GUIOdyssey 筛出 500 条真实手机轨迹,共 4905 次转移,平均 9.81 步,覆盖 130 个 App。从真实初始屏出发,世界模型沿参考语义动作自回归生成后续界面;参考截图只用来打分,不喂回模型。语义动作是 tap、scroll、navigatehome 这类,带自然语言目标描述,不靠像素坐标复现。轨迹经过启发式过滤、GPT-5.5 单步合理性检查,再按状态依赖步数和多样性选出。

在线 agent 环赛道做了 200 个在 Android 模拟器里人工跑通的任务,覆盖 30 个 App、18 个模板,平均 4 个有序里程碑。步数预算大约是人工完成步数的两倍。探测 agent 固定为 GPT-5.5,在模型生成的界面上自己选动作,测闭环进度。

四组指标拆开局部生成和轨迹级环境可用性:转移保真看元素对齐、布局和 SigLIP/DINO 全局相似;转移合理性看动作是否生效、是否可识别、界面是否还能继续点;上下文一致性看任务相关状态是否还在、rollout 有没有漂、冻、循环;任务进度离线看参考动作能连续执行多长前缀,在线看有序里程碑前缀。能吃历史的模型另报 w/ history,最多拼前 3 对观察-动作。一共评了 12 个世界模型、每条赛道 18 个配置。代码或 HTML 生成后再渲染成截图,图像模型直接出图。VLM 裁判冻成 GPT-5.5。

结果

任务进度是最难的一维。离线赛道最好的参考动作进度只有 16.7,来自 GPT Image 2;Claude Opus 4.7 带历史是 16.4,综合分最高 57.6。多数 rollout 很快就撑不住后面的参考动作。

模型设置可用性任务进度Overall
Claude Opus 4.7w/ history99.616.457.6
GPT Image 2w/o history99.916.755.0
Flux.2-devw/o history94.10.024.3
MobileWorld-Diffusionw/o history20.80.210.4

在线赛道 GPT-5.5 带历史综合 90.3、里程碑进度 70.9,去掉历史掉到 82.5 和 51.2。专用 GUI 世界模型明显更弱:Code2World 带历史里程碑 32.2,gWorld-32B 是 24.4,MobileWorld-Diffusion 综合只有 8.2。

全局相似容易,细粒度保真难。最好的元素对齐和布局完整性都低于 20,SigLIP 却能到 70 出头。Flux.2-dev 是极端例子:两边赛道可用性都很高,任务进度接近零。它在画能看的 GUI,没在建模动作后果。

历史能抬一致性,抬不动任务进度。Code2World 离线参考动作进度从 9.1 只到 9.5。人工抽了 GPT-5.5 和 GPT Image 2 的 200 条失败 rollout:约 42% 缺 App 或 Android 转移知识,33% 是早期偏差被自回归放大,25% 是上下文不一致,比如丢 App 身份、忘输入文本、launcher 布局被重采样。这些错误 teacher forcing 评测看不见。

为什么重要

谁想用世界模型替代真机做 GUI agent 训练或评测,这篇把「看起来像」和「能当环境」拆开了。现在的模型还不能当可复用环境。短历史记忆解决不了长程状态,下一步更需要持久状态表示和更强的动作-效果知识。做 GUI 世界模型的人,优先盯任务进度和状态持久,别只报单步相似度。

这是评测贡献,不是新模型。它把先前基准没测的那一维做成了可复现协议,代码和数据都公开。

局限与存疑

作者自己写了:目前只覆盖手机 GUI,没做 web 和桌面;在线赛道只用一个固定探测 agent;VLM 裁判会漏掉选错条目、残留旧查询这类细粒度状态错误;不同世界模型的原生接口还没完全对齐。

另外几处要打折扣。离线保真拿单一 ground-truth 下一屏当标靶,合理但不同的下一屏会被罚。GPT-5.5 同时当探测 agent 和裁判,存在自我偏好。轨迹筛选和单步合理性检查也用了 GPT-5.5,基准本身带模型痕迹。历史只拼 3 步,「历史不够用」不能外推到更长记忆或显式状态模块。

术语

原文与代码

相关论文

全部论文解读