AA 搜索榜方法论:26 款产品、13 家供应商如何被评测
ArtificialAnlys · x · 2026-10-06
Artificial Analysis 附上本次搜索评测的相关链接:榜单页、方法论页(含 OpenAI Web Search 的运行方式)、以及用于所有 Search API 测试行的开源 agent harness Stirrup。Search API 供应商可联系他们申请纳入榜单。
配套页面介绍:该基准横跨 13 家供应商的 26 款 Search API 产品,从底层网页索引、结果呈现方式、以及成本/速度/检索质量权衡等维度评测,帮助开发者为 deep research、编码等 agent 场景选型;得分为 DeepSearchQA、BrowseComp、AA-Omniscience 三项的等权平均(0–100),所有结果使用同一候选回答模型。数据截至 2026 年 9 月 28 日。
所属事件:OpenAI Web Search 首入评测榜:74 分列第五,单任务约 5 美分(4 条相关)→
「模型」频道最新
- Liquid AI 新决策模型免专项训练,四项质检任务准确率最高 97% — JosephJacks_ · 2026-10-06
- QuantCode:领域预训练+SFT 让开源模型交易代码通过率翻倍 — Alexey Chernysh · 2026-10-06
- GLM-5.3 疑似具备上下文感知,会自称上下文余量不足 — khademinori · 2026-10-06
- Azure 目录短暂曝光 OpenAI 未发布模型 GPT-6.1-Sol,页面一小时内被撤下 — _AndrewZhao · 2026-10-06
- Opus 5.5 订阅划算但 API 昂贵,6.1 才能当主力干活的马 — haider1 · 2026-10-06
- 用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端 — PMinervini · 2026-10-06