腾讯混元推出 WebCraftBench:Agent 实测网页应用,人偏好匹配度 85.3%
TencentHunyuan · x · 2026-09-22
腾讯混元团队发布 WebCraftBench,一个从软件测试视角评测 LLM 网页应用生成的交互式基准。
动机:静态基准会给源码中存在但运行时不可达的功能加分;交互式基准则因探索不完整而漏测功能,且容易把应用缺陷与 agent 执行失败混为一谈。
方法:
- 对每个生成的应用插桩,用代码覆盖率引导 agent 通过模拟用户交互探索功能
- 将交互轨迹抽象为状态转移图
- 从视觉美观、可用性、需求对齐三个维度评分,探索与评分分离
规模与结果:包含 369 个真实用户需求和 5,088 条验收标准;在 197 个经人工验证的样本对上,评分与人类偏好匹配率达 85.3%;团队还评测了 17 个前沿 LLM。
「编程与Agent」频道最新
- 嫌奥地利税务网站太难用,开发者让 Codex computer use 代为操作 — kevinkern · 2026-09-22
- 多 agent 群聊协作实操:丢个任务睡一觉,醒来验收成品 — huangyun_122 · 2026-09-22
- 7 个开源爬虫项目盘点:自适应抓取到 AI 驱动提取一应俱全 — JafarNajafov · 2026-09-22
- 观点:若 Agent 能代劳,外卖电商等 App 将被原生替代品颠覆 — vaibhavbetter · 2026-09-22
- 哪些决策永远不该交给 AI Agent 自主执行?退款是个好例子 — ConvertMyStore · 2026-09-22
- Obsidian Starter Kit v4 发布:375 个 AI 技能把笔记库变成智能体基地 — dSebastien · 2026-09-22