OpenRouter推出Web搜索基准测试,涵盖多模型与配置排名

AravSrinivas · x · 2026-08-14

OpenRouter宣布推出Web Search Benchmarks,提供不同模型和配置下搜索工具的排名,帮助用户决定如何为agent提供grounding。基准测试包括τ²-Bench Airline、GPQA Diamond、BrowseComp、DeepSearchQA和HLE等,每个分数都链接到配置、成本和遥测数据。例如,在BrowseComp中,Perplexity with Claude Opus 5 (high)以89.0%的质量得分领先;在DeepSearchQA中,Perplexity with Claude Opus 5 (high)以76.5%领先。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →