WebFovea 获 WebRetriever 挑战赛亚军:多数失败在 harness 而非模型
Jiangang Han · hf · 2026-10-08
作者团队发布 WebFovea,一个视觉型网页 Agent,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名。该挑战基于 WebRetriever 基准 Protocol III,要求 Agent 从入口 URL 出发在真实网站上操作界面并返回可验证答案。
核心发现:模型能力是必要但不充分条件——模型决策要经过 harness(模型与页面之间的代码)才能到达浏览器,每一步有四件事必须做对:
- 模型回复被正确解析为预期动作
- 动作在页面上真正生效
- 结果被准确回报给模型
- 模型能看到它需要的信息
在真实网站上,许多失败发生在上述四个阶段而非模型推理环节。典型案例:坐标系错位导致每次点击落在目标坐标的 3/4 处;原生下拉框、iframe、文本框内的操作静默失败;自生成的 chat-template token 污染了 4.9% 的任务轮次。
由于四次提交用的是同一个模型,官方隐藏集分数从 31.0 提升到 57.0 完全来自 harness 的加固(含运行间方差)。文章给出了各组件的证据(含负面结果)、失败分析、局限与路线图(如不同步骤路由到不同模型)。代码已开源:https://github.com/jianganghan/WebFovea
「编程与Agent」频道最新
- 构建模拟世界的经验:造世界容易,让它在破烂机器上跑很难 — gandamu_ml · 2026-10-08
- FrugaLLM 开源:免费端点自动切换最强模型驱动 agent — KalKyl · 2026-10-08
- 微软 WSL2 内核更新至 Linux 6.18.54.1,DXGKRNL 原生 fence 共享 — unixterminal · 2026-10-08
- MCP 被批过度设计却成行业标准,开发者吐槽违反 KISS 原则 — wordgrammer · 2026-10-08
- 4B token 才写个棋类网页:圈外人 vibe coding 最大败因是不懂精确提问 — trq212 · 2026-10-08
- Google 在印度推出 Chrome Auto Browse,AI 可代你订车位填表单 — laparisa · 2026-10-08