斯坦福研究发现,网页搜索型 LLM 最大短板不是推理而是检索
The Batch (Andrew Ng) · rss · 2026-07-24
斯坦福大学和 Together AI 的研究发现,带网页搜索的 LLM 在新闻问答任务中,短板往往不是推理,而是检索。
研究者在六种语言上测试了多款模型后发现:当问题表述清晰、且包含正确前提时,模型通常表现不错;但一旦问题带有错误信息、检索到不相关文档,或无法从文档里抽取事实,错误就会明显增多。最常见的失误来源是检索失败,Hindi 表现最差,而且模型经常在非英语问题上优先引用英文来源。作者因此认为,提升索引覆盖、排序质量和多语言检索能力,可能比单纯扩大模型更能改善面向新闻的 agent 搜索。
「应用」频道最新
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- Photoshop 终于支持自定义清理 Save As 格式列表 — rufusd · 2026-09-11
- 博主开源 X 四图轮播玩法:切图器+一句话生成四格叙事图 — sujingshen · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- 反向提问法:让 AI 反过来采访你,输出更贴合需求 — thisdudelikesAI · 2026-09-11
- 提示词技巧:给角色加约束条件才真正有用 — thisdudelikesAI · 2026-09-11