HyperBrowseComp 发布:13 种语言 423 题压测浏览 agent
zmkzmkz · x · 2026-10-06
研究团队发布 HyperBrowseComp,一个面向网页浏览 agent 的多语言、多模态压力测试基准(arXiv:2610.03574)。
- 共 423 道由母语者人工撰写并验证的题目,覆盖 13 种语言,设计上极其困难
- 答案需简短且可公开验证,但要求追踪多步线索链、在视频、扫描件、图片、地图等异构来源中定位冷门证据
- 通过无联网模型过滤掉可凭参数知识直接回答的简单题
- 在统一 agent 协议下评测了多个模型,并做了人类对照评测
作者之一称其德语题目是最难的一批。如果你认为 "tip-of-my-tongue" 式深度检索是衡量 agent 能力的好指标,可以用它测试你常用的 LLM 与 agent 框架。
所属事件:HyperBrowseComp 发布:13 种语言 423 题压测浏览 Agent(2 条相关)→
「编程与Agent」频道最新
- Rippling 用 Deep Agents 与 LangSmith 6 个月上线全产品 AI — LangChain · 2026-10-06
- COLM 举办自我改进智能体社交:四场演讲聚焦技能进化与脆弱性 — tuvllms · 2026-10-06
- 微软团队分享微调模型胜任 Excel 等知识工作的演讲 — marlene_zw · 2026-10-06
- 生产环境里怎么改 Agent 权限?Reddit 工程师征集实践方案 — BaraSlim · 2026-10-06
- Armin Ronacher 详解 Codemode:Pi 1.0 为何用代码而非 MCP 工具 — mitsuhiko · 2026-10-06
- T3 Code 上线应用内可视化,Agent 可在会话中构建动态体验 — 0xkarasy · 2026-10-06