自称第三方产品 Scry 在 DeepSearchQA 上以 71.8% 胜 Gemini 的 66.1%
AaronBergman18 · x · 2026-09-06
X 账号 XyraSinclair(经 AaronBergman18 转发)宣称其深度搜索产品 Scry 在 DeepSearchQA 基准上击败 Google 的 Gemini Deep Search Agent:Scry 得分 71.8%,Google 为 66.1%。
DeepSearchQA 是 Google 团队发布在 arXiv 的 900 题基准,用于评测深度研究型 agent 在 17 个领域的多步信息检索能力,任务为因果链结构,重点考察碎片信息汇总、去重与实体消解、以及开放搜索空间下的停止判断。论文指出即使最先进的模型也难以兼顾召回率与精确率,常见失败模式包括过早停止与含糊作答。
注意:该对比成绩来自非官方第三方宣称,尚未经独立验证。
「模型」频道最新
- 传闻称 Astra 低档到 xhigh 推理差距仅 1% — BLUECOW009 · 2026-09-06
- 从"下一个词预测器"到 GPT-6 Astra:传言引热议 — DeryaTR_ · 2026-09-06
- Yacine 吐槽:模型史上最强,却仍需全程盯着用 — yacineMTB · 2026-09-06
- 网络安全从业者吐槽 Claude 护栏太严,转问 Astra 能不能用 — GVTZ59 · 2026-09-06
- Fable 5.1 医疗问题不再拒答,用户体验远好于 Fable 5 — JeremyNguyenPhD · 2026-09-06
- ChatGPT Pro 手动重置额度反而推迟周限重置时间 — dmpizzle · 2026-09-06