斯坦福研究发现,网页搜索型 LLM 最大短板不是推理而是检索
The Batch (Andrew Ng) · rss · 2026-07-24
斯坦福大学和 Together AI 的研究发现,带网页搜索的 LLM 在新闻问答任务中,短板往往不是推理,而是检索。
研究者在六种语言上测试了多款模型后发现:当问题表述清晰、且包含正确前提时,模型通常表现不错;但一旦问题带有错误信息、检索到不相关文档,或无法从文档里抽取事实,错误就会明显增多。最常见的失误来源是检索失败,Hindi 表现最差,而且模型经常在非英语问题上优先引用英文来源。作者因此认为,提升索引覆盖、排序质量和多语言检索能力,可能比单纯扩大模型更能改善面向新闻的 agent 搜索。
「应用」频道最新
- 定时用户反馈能自动修 bug,还能挖出产品洞察 — yangyi · 2026-07-27
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- YC 为 Startup School 推出 AI Office Hours 模拟器 — ycombinator · 2026-07-27
- VibeLoft 榜单启示:AI 产品主打省钱与信息差 — ezshine · 2026-07-27
- Hermes agent 把 subnet 调研自动生成 EPUB 上 Kindle — markjeffrey · 2026-07-27
- Meta被曝允许虚假AI医生在平台推销伪劣疗法 — jonerp · 2026-07-27