WebStep:超越成功率,实现 Web Agent 过程级评测的新基准
algo_diver · x · 2026-08-13
被 COLM 2026 接收的新研究 WebStep 提出了一种针对 Web 智能体的过程级评测方法。现有的基准通常只关注最终的成功率,但两个智能体可能在同一个任务上失败,且失败原因完全不同。
WebStep 通过引入一个 MDP 观察器,自动将智能体在真实网站上的底层 GUI 操作(如点击坐标)转化为语义级别的动作和状态(如 ViewRepo)。该基准包含 10 个自托管网站上的 1800 个任务实例。
基于记录的轨迹,WebStep 能够计算探索范围、技能调用和执行效率等过程指标,并精准定位智能体究竟是在哪一步偏离了正确方向,从而揭示那些在相似成功率下被掩盖的行为差异。
「编程与Agent」频道最新
- 开发者打造51个专业AI智能体预设,获星标14万 — nikola_mr64990 · 2026-08-13
- 谷歌工程师演示用 Claude 26 分钟从零构建完整应用 — Roger_M_Taylor · 2026-08-13
- 前 AWS 高管用 3 词提示词运行 34 个 AI 智能体 — Roger_M_Taylor · 2026-08-13
- AI自动化卡在最后一公里:如何解决交付前的上下文痛点 — Growthseeker23 · 2026-08-13
- CAD 变聊天框:用 Claude 语音指挥修改 3D 模型 — TinfoilTricorn · 2026-08-13
- AI工作流烧钱:两月API账单超千刀 — lipeng0820 · 2026-08-13