WebRetriever:大规模网页智能体任务评测基准与LLM评判器

_reachsumit · x · 2026-07-08

研究团队推出WebRetriever,一个用于评估网页智能体效率与任务完成能力的大规模综合基准,覆盖多类型网页交互任务场景。同时引入基于LLM的评判机制,对智能体任务成功率进行自动化打分,降低人工标注成本。该基准为衡量和推进网页智能体能力提供了标准化平台。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →