美团 LoHoSearch 开源:762 万实体知识图谱把搜索题做难了
美团技术团队 · wechat · 2026-07-23
LoHoSearch:用 762 万实体知识图谱自动出题,搜索智能体更难了
美团 LongCat 团队发布了 LoHoSearch,一个面向搜索智能体的新基准,不再依赖人工想题,而是基于大规模维基百科知识图谱自动生成高难问题。
- 知识图谱覆盖 762 万 个实体、2.65 亿 条有向边。
- 基准包含 544 道经人工核验的题目,覆盖 11 个领域。
- 难度从两个维度控制:搜索空间 和 结构复杂度。
- 生成流程包括建图、子图采样、题目生成、自动验证和人工复核。
评测结果
LoHoSearch 对当前最强搜索模型形成了明显挑战:
- GPT-5.5 最高也只有 34.74%。
- DeepSeek-V4-Pro、Claude-Opus-4.6、Kimi-K2.6 集中在 15.53%–15.99%。
- 其余模型都低于 14%。
额外发现
- 解题平均工具调用次数从 BrowseComp 的 35 次升到 61 次。
- 重复采样有帮助,但 pass@16 也只到 38.3%。
- 常见上下文管理策略在这里的收益只有 6.8 个百分点,明显低于 BrowseComp。
这项工作强调:当问题由知识图谱系统化构造后,搜索智能体的长程推理和上下文管理短板会被更明显地暴露出来。
「编程与Agent」频道最新
- Claude 语音模式接入外部工具,可直达邮箱、Notion 和 Vercel — koltregaskes · 2026-07-23
- Netlify 把 Drop 和 Agent Runners 结合,几分钟完成站点改动 — thisiskp_ · 2026-07-23
- 推理成本下降,让专用 agent 和评测更适合落地 — LangChain · 2026-07-23
- CLI 加实时预览界面,让 agent 处理非编程工作 — mattpocockuk · 2026-07-23
- AI 工程被拆成四层:prompt、context、harness 与 loop — victorialslocum · 2026-07-23
- AI agents 还远没到放手自治,现实里总得人盯着 — IanArawjo · 2026-07-23