新基准实测:AI 智能体漏看四分之一的互联网
EXM7777 · x · 2026-08-27
一个新发布的基准专门测试 AI 智能体在每日变化的实时网页数据上的搜索能力,因此无法靠记忆答案作弊。结果显示:表现最好的工具也只能找到实际存在内容的 75%,Google 的 API 找到 53%,而在最难的查询上,即便是「最好的工具」也会漏掉近一半结果。
发帖人的结论是:大家都在争论哪个模型最聪明,但底层搜索层是半盲的——修好搜索层比调 prompt 更优先。
「编程与Agent」频道最新
- 真正的智能体工程:AI Agent 闭环接管 CI/CD 全流程 — Pavan_Belagatti · 2026-08-28
- 观点:AI Agent 应整合为单一工作流而非工具链 — AIwithGhotai · 2026-08-28
- Traycer Desktop 1.2 更新:支持接入 HF 开源模型 — victormustar · 2026-08-28
- Linus 调试 Intel 显卡 Bug:AI 断言无解,人类坚持修复 — bendee983 · 2026-08-28
- AI Agent工作流技巧:用廉价agent并行搜索上下文 — brandon_galang · 2026-08-28
- OpenWiki 0.4.0 支持 OKF v0.2:页面级信任与来源溯源 — LangChain · 2026-08-28