斯坦福研究发现,网页搜索型 LLM 最大短板不是推理而是检索

The Batch (Andrew Ng) · rss · 2026-07-24

斯坦福大学和 Together AI 的研究发现,带网页搜索的 LLM 在新闻问答任务中,短板往往不是推理,而是检索。

研究者在六种语言上测试了多款模型后发现:当问题表述清晰、且包含正确前提时,模型通常表现不错;但一旦问题带有错误信息、检索到不相关文档,或无法从文档里抽取事实,错误就会明显增多。最常见的失误来源是检索失败,Hindi 表现最差,而且模型经常在非英语问题上优先引用英文来源。作者因此认为,提升索引覆盖、排序质量和多语言检索能力,可能比单纯扩大模型更能改善面向新闻的 agent 搜索。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →