MBZUAI 发布 HyperBrowseComp:13 语种 423 题压测浏览 Agent
MBZUAI · hf · 2026-10-05
MBZUAI 推出 HyperBrowseComp,一个多语言多模态的网页浏览 Agent 基准。
- 423 道人工撰写并经人工验证的题目,覆盖 13 种语言,均由母语或高水平使用者编写
- 题目设计极难:答案需发现隐晦证据、跟随多步线索链,或检查视频、扫描文档、图片、地图等异构来源;答案简短且公开可验证
- 用无联网模型预先过滤易题,降低靠参数知识作答的可能
- 统一 Agent 协议下,用厂商原生搜索与共享外部检索框架评测多个模型,并抽样做人类评测作为参照
定位:跨语言、跨证据模态的持久性信息搜寻的严苛测试场,难度来自开放网络中证据的发现与串联。
「编程与Agent」频道最新
- 把 Claude 放进 VRChat:蝴蝶形象能听能看,翅膀还会自己写代码 — repligate · 2026-10-05
- 同一批模型换壳对比:Claude Code 体验为何垫底 — intellectronica · 2026-10-05
- Agent 运行时护栏怎么落地?Reddit 工程师求实用经验 — Patieusmdaxnt_in3241 · 2026-10-05
- vibecoder 共识:每个 AI 编程玩家都该自建 LLM 监控 — ssh4net · 2026-10-05
- 在 Steam Frame 上端侧 vibe coding 开发 OpenXR VR 应用 — ZeroStateReflex · 2026-10-05
- Code review 新定位:从必经流程变为风险管控 — intellectronica · 2026-10-05