OpenAI Web Search 首登搜索榜:74 分列第 5,单价约 5 美分
ArtificialAnlys · x · 2026-10-06
Artificial Analysis 将 OpenAI Web Search 纳入其 Search Index 榜单,得 74 分,位列第 5,排在 Perplexity、Octen、Parallel 和 Brave 之后;相比同一模型无搜索时的 33 分,提升 41 分。这是榜单上首个第一方集成搜索工具:由 GPT-5.6 Luna(medium reasoning)在单次 Responses API 调用中调用内置 websearch 工具完成整个搜索循环。
关键数据:
- 成本约 $0.05/任务(搜索约 $0.04 + 模型约 $0.009),比 25 个 Search API 产品中的 17 个便宜(中位数 $0.067),但约为 Octen($0.024、77 分)的两倍,处于成本前沿之下
- 在自有事实问答基准 AA-Omniscience 上达 72% 准确率,26 个变体中排第 3,仅落后榜首 Firecrawl 1 个点
- 弱项是需多跳推理的 BrowseComp:73.5%,排第 13,明显落后于 Perplexity 系列和 Octen(85%–87%)
- token 用量更省:每任务约计费 4 万输入 token(含搜索结果),而最省的 Search API(Perplexity low)需 12.5 万
- 定价为每千次 websearch 调用 $10,搜索内容按模型输入 token 计费;通过工具的域名过滤器屏蔽已知污染源
所属事件:OpenAI Web Search 首入评测榜:74 分列第五,单任务约 5 美分(4 条相关)→
「模型」频道最新
- Sander Dieleman 长文:连续扩散语言模型为何卷土重来 — LucaAmb · 2026-10-06
- 30B 激活参数打平 480B+ 模型:ROME 智能体基准成绩公布 — thisguyknowsai · 2026-10-06
- Reflection AI 发布 501B-A23B 模型 Beam,跑分介于 GLM 5.2 与 5.3 之间 — iaziaz · 2026-10-06
- 博主对比:$200 Claude Max 比 $500 ChatGPT 更耐用更快更强 — AlchainHust · 2026-10-06
- FLUX 3 登顶 DeepMind 物理理解基准 Physics-IQ 榜首 — bfl_ai · 2026-10-06
- Reflection 新开源模型不敌中国主力模型,融资数十亿遭群嘲 — npinto · 2026-10-06