WebFovea 获 WebRetriever 挑战赛亚军:多数失败在 harness 而非模型

Jiangang Han · hf · 2026-10-08

作者团队发布 WebFovea,一个视觉型网页 Agent,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名。该挑战基于 WebRetriever 基准 Protocol III,要求 Agent 从入口 URL 出发在真实网站上操作界面并返回可验证答案。

核心发现:模型能力是必要但不充分条件——模型决策要经过 harness(模型与页面之间的代码)才能到达浏览器,每一步有四件事必须做对:

在真实网站上,许多失败发生在上述四个阶段而非模型推理环节。典型案例:坐标系错位导致每次点击落在目标坐标的 3/4 处;原生下拉框、iframe、文本框内的操作静默失败;自生成的 chat-template token 污染了 4.9% 的任务轮次。

由于四次提交用的是同一个模型,官方隐藏集分数从 31.0 提升到 57.0 完全来自 harness 的加固(含运行间方差)。文章给出了各组件的证据(含负面结果)、失败分析、局限与路线图(如不同步骤路由到不同模型)。代码已开源:https://github.com/jianganghan/WebFovea

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →