WebRetriever:大规模网页智能体任务评测基准与LLM评判器
_reachsumit · x · 2026-07-08
研究团队推出WebRetriever,一个用于评估网页智能体效率与任务完成能力的大规模综合基准,覆盖多类型网页交互任务场景。同时引入基于LLM的评判机制,对智能体任务成功率进行自动化打分,降低人工标注成本。该基准为衡量和推进网页智能体能力提供了标准化平台。
「编程与Agent」频道最新
- Agent Arena 发布 agent 评测因果追踪方法与完整榜单 — arena · 2026-07-21
- Codex Micro 把多智能体混乱做成了状态面板梗图 — shaunralston · 2026-07-21
- Anthropic 开发者体验负责人将讲 coding agents 的 API 体验 — craigsdennis · 2026-07-21
- 企业正在招聘 AI Agent 工程师,IBM 列出 7 项核心技能 — ZabihullahAtal · 2026-07-21
- 开源先解决信任,再解决流量 — dotey · 2026-07-21
- Profound成为Anthropic官方连接器 — ditzikow · 2026-07-21