评测显示Web搜索大幅缩小模型间准确率差距
PolarBearby · x · 2026-09-01
Braintrust 评测了 1329 个时事问题,对比了 4 个模型在 14 种条件下的表现。关键发现:
- 缩小差距:搜索使模型间的准确率差距从 47.9 分降至 5.6 分。
- 时效性衰减:检索增益随事件发生时间而下降,近期事件提升约 45 分,较旧事件约 24 分。
- 边际效应:运行 5 次以上搜索的得分为 19-49%,第五次查询通常与性能下降相关。
- You.com 表现:在 GPT-5.6 Terra 上,You.com 搜索比内置搜索准确率高 3.66 分,且快 3.40 秒,成本低 $0.0051。
「编程与Agent」频道最新
- 在 4 张 2080 Ti 上构建私有 AI 操作系统 — askincihan · 2026-09-01
- Grok 4.6 联动 Unity 与 Blender 原型网球场 — chongdashu · 2026-09-01
- 多Agent内存架构实操:定向检索优于统一存储 — Fun-Following-1723 · 2026-09-01
- Vapi Voice Agent 隐形坑:start() 静默失败 — skywave84 · 2026-09-01
- 解决 Agent 被侦测与记忆丢失:驱动真浏览器与本地存储方案 — Spliff_77 · 2026-09-01
- WebWorld:将浏览器作为自改进 Web 代码的世界模型 — IQuestLab · 2026-09-01