OpenRouter推出Web搜索基准测试,涵盖多模型与配置排名
AravSrinivas · x · 2026-08-14
OpenRouter宣布推出Web Search Benchmarks,提供不同模型和配置下搜索工具的排名,帮助用户决定如何为agent提供grounding。基准测试包括τ²-Bench Airline、GPQA Diamond、BrowseComp、DeepSearchQA和HLE等,每个分数都链接到配置、成本和遥测数据。例如,在BrowseComp中,Perplexity with Claude Opus 5 (high)以89.0%的质量得分领先;在DeepSearchQA中,Perplexity with Claude Opus 5 (high)以76.5%领先。
「研究」频道最新
- 高中生用 AI 分析 NASA 数据,发现 150 万个潜在变星 — PeterDiamandis · 2026-08-15
- AI 重处理 8 万 PDB 结构,揭示 6 万+ 蛋白质动态构象 — anshulkundaje · 2026-08-15
- CMU 博士谈自适应智能体:从记忆技能到上下文适配,挑战何在? — Diyi_Yang · 2026-08-15
- xbow发布1600个Agent漏洞分析:基准已饱和,多步攻击成常态 — moyix · 2026-08-15
- 新论文:150M模型ARC-AGI得分29.5%,每任务成本仅0.0007美元 — burny_tech · 2026-08-15
- ProteinDPO登Nature Methods:蛋白质生成模型对齐实验适应性 — BrianHie · 2026-08-15