SimpleQA 实测里 Firecrawl 以 94.7% 领先 Exa 和 Claude 搜索
Candid-Dog-775 · reddit · 2026-07-28
一位 Reddit 用户用同一套 GPT-5.4 agent 配置,对 Firecrawl、Exa、Parallel 和 Claude 原生搜索做了 SimpleQA 实测对比;每题最多允许 20 次搜索或抽取调用,最后用 OpenAI 官方的评分提示词打分。
在 1000 道题上,结果分别是:
- Firecrawl:947 题正确,94.7%
- Exa:919 题正确,91.9%
- Parallel:910 题正确,91.0%
- Claude Native Search:905 题正确,90.5%
- 不带搜索的 GPT-5.4 基线:43.8%
结论是:搜索提供方确实会影响效果,但在这次测试里四家都超过了 90%;其中 Firecrawl 和 Exa 表现最好。
「模型」频道最新
- OpenAI 的“GPT-6”玩梗拿推理降本和效率提升开刀 — daniel_mac8 · 2026-07-28
- 回复称下一版 Codex 可能周二发布,Cerebras 也将跟进 — eyishazyer · 2026-07-28
- Kimi K3 权重刚发布几小时,就引出一场混合架构与 Agent 讨论 — hugobowne · 2026-07-28
- 有人认为 Anthropic 只是在模型领先上略占薄边 — intellectronica · 2026-07-28
- Google Gemma 4 Vision 的 token budget 演示在 Hugging Face 走红 — google · 2026-07-28
- 作者称 GPT 5.6 Ultra 做 Agent 过于不稳定 — tensorqt · 2026-07-28