新基准实测:AI 智能体漏看四分之一的互联网

EXM7777 · x · 2026-08-27

一个新发布的基准专门测试 AI 智能体在每日变化的实时网页数据上的搜索能力,因此无法靠记忆答案作弊。结果显示:表现最好的工具也只能找到实际存在内容的 75%,Google 的 API 找到 53%,而在最难的查询上,即便是「最好的工具」也会漏掉近一半结果。

发帖人的结论是:大家都在争论哪个模型最聪明,但底层搜索层是半盲的——修好搜索层比调 prompt 更优先。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →