WebStep:超越成功率,实现 Web Agent 过程级评测的新基准

algo_diver · x · 2026-08-13

被 COLM 2026 接收的新研究 WebStep 提出了一种针对 Web 智能体的过程级评测方法。现有的基准通常只关注最终的成功率,但两个智能体可能在同一个任务上失败,且失败原因完全不同。

WebStep 通过引入一个 MDP 观察器,自动将智能体在真实网站上的底层 GUI 操作(如点击坐标)转化为语义级别的动作和状态(如 ViewRepo)。该基准包含 10 个自托管网站上的 1800 个任务实例。

基于记录的轨迹,WebStep 能够计算探索范围、技能调用和执行效率等过程指标,并精准定位智能体究竟是在哪一步偏离了正确方向,从而揭示那些在相似成功率下被掩盖的行为差异。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →