EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants
Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen
cs.AI, cs.SE
2026-08-30
NYU上海提出EvoGenUI-Bench:150个五轮任务测8个模型维护可执行界面。最强Claude-Opus-4.7单轮74.9%,整段只有37.3%;工具接地任务相邻保留率仅52.4%。
大模型已经能一次生成仪表盘、表单、小应用。现有基准大多评的是这一次出得漂不漂亮、能不能跑。产品里的生成式 UI 很少一次交付:用户加筛选、改约束、接外部状态,同一个可执行界面要跟着改,而且前面还有效的功能不能丢。
WebArena 一类评的是 agent 在现成网站上操作;FrontendBench、MiniAppBench 评的是从零生成页面。中间缺的是:模型自己造的界面,作为持续交互层,能不能在连续修订里保住行为、派生状态、外部状态和口头说明的同步。NYU 上海把这个设定叫 EvoGenUI。
EvoGenUI-Bench 共 150 个任务、750 轮,三套场景各 50 个:信息呈现、可执行交互、工具接地的外部状态。每个任务五轮,都是在同一个界面上累加修订,不是五张独立页面。模型每轮要交用户可见回复和完整源码。
防泄漏的做法是把生成器可见输入和私有校验拆开。模型只看到用户请求、公开上下文和工具契约;私有校验需求、后端状态、打分标准对它不可见。每条私有需求至少绑一块可观察证据:截图、DOM、交互轨迹、源码、回复、工具日志或运行时状态。任务全部人工撰写,第二审稿人查清晰度、泄漏、跨轮压力和可观测性。校验密度故意不同:呈现平均每轮 3.0 条需求,交互 5.9,工具接地 11.9。
评测流水线把源码打进固定的 React/Vite 环境,浏览器里跑起来,用交互 actor 点界面。三个维度各至少 4 分才算通过:呈现(布局可读、领域合适)、执行(当前请求和仍有效的旧需求真能工作)、对齐(回复、源码、界面、交互观察、运行日志互相不打架)。过不了构建的直接记失败。
四个指标从同一套通过判定导出。Turn Pass 是单轮通过率;TP@5 是五轮全过的任务比例;CPT 是从第一轮起连续通过的平均长度;APR 是「上一轮过了、这一轮生成也返回了」的条件下这一轮仍通过的比例。主实验用 MiMo-V2.5 同时当 actor 和裁判。
八个模型里最强的是 Claude-Opus-4.7:总 Turn Pass 74.9%,APR 83.6%,但 TP@5 只有 37.3%,CPT 2.81。模型平均 Turn Pass 42.7%,TP@5 掉到 11.8%。单轮好看,整段维护撑不住。
| 模型 | Turn Pass | TP@5 | APR |
| Claude-Opus-4.7 | 74.9% | 37.3% | 83.6% |
| GPT-5.5 | 61.7% | 21.3% | 71.0% |
| Claude-4.5-Haiku | 51.1% | 13.3% | 65.7% |
| Qwen3.6-Plus | 44.0% | 7.3% | 61.7% |
| 八模型合计 | 42.7% | 11.8% | 66.5% |
工具接地最难:平均 Turn Pass 25.0%,TP@5 5.0%,APR 仍只有 52.4%(呈现 71.1%,交互 68.7%)。八个模型里只有 Opus 和 GPT-5.5 在工具接地拿到 20.0% 的 TP@5,其余全是 0。通过率在第 2 轮之后明显下滑,第 3 轮 39.4%、第 4 轮 35.1%;工具接地从第 2 轮 39.5% 掉到第 3 轮 18.5%、第 4 轮 14.0%。
失败机制按套件分开。2750 次未通过调用里,信息架构 859、派生状态传播 586、控件绑定 460、需求分解 410、外部状态接地 289、领域表征 146。呈现失败主要是信息架构;交互失败是派生状态不更新,以及按钮看起来能点其实没接线;工具接地再加上外部状态对不上、需求漏拆。后验抽查 110 次 APR 失败,52.7% 含对旧行为的回退,47.3% 只是新需求没做成。
自动裁判对 240 条盲测的准确率 86.7%,Cohen's κ = 0.73。证据消融里,拿掉 actor 轨迹准确率从 87.5% 掉到 55.0%,比拿掉截图(78.3%)伤得更重。
生成式 UI 如果只看单次截图或单轮分数,会把「能交差」误读成「能维护」。产品场景几乎都是连续改界面:加过滤、改约束、接真实后端。这篇把评测单位从一张页面改成一条修订轨迹,并且强制行为、派生状态、外部状态和口头声明对齐。
对做 coding agent 和生成式界面的人,可直接复用的不是排行榜名次,是失败分类:布局乱、状态脏、控件空接、工具令牌对不上。这些是工程问题,换一个更强模型也不会自动消失。Opus 在工具接地仍只有 20% 的五轮全过。
任务是人工写的五轮剧本,环境锁死 React/Vite,没有真实交互日志、无障碍、多设备。APR 是结果层面的保留率,不是因果归因。工具接地用确定性 mock 运行时,测不到延迟、鉴权失败、限流和接口变更。
裁判和 actor 都是 MiMo-V2.5,存在自我一致性偏好的风险。附录里换配对后与人工一致率在 86.1% 到 91.4%,主配置 89.7%,没有明显偏高。Qwen3.6-Plus 三次独立生成的 Turn Pass 在 39.7% 到 46.4% 之间晃,绝对分数不稳,套件难度排序稳定。私有需求密度在工具接地高很多,跨套件差距混了「外部状态难」和「检查项更多」两件事。