Wikidata Search Traces 数据集发布:训练知识图谱搜索 Agent 的 1 万条轨迹
omarsar0 · x · 2026-10-08
arXiv 论文《Wikidata Search Traces》发布了一个用于训练知识图谱搜索 Agent 的数据集。核心思路是让模型学会「导航式搜索」而非靠记忆答题。
- 问题设定:在 Wikidata 上回答复杂问题通常需要写出正确的 SPARQL 查询;LLM 则倾向凭记忆回答,对冷门实体最不可靠。
- 两个障碍:缺少记录解题探索过程的训练数据;现有接口把大块图谱结果直接塞进模型上下文。
- 三个假设被验证:图谱搜索难度可通过问题的嵌套条件结构控制;长程搜索的失败主要源于证据管理方式而非模型本身;合适的环境下开源权重模型可媲美闭源商业模型。
- 构建方法:在冻结的 Wikidata 快照上用嵌套条件替换命名实体生成多跳问题,并逐步校验目标唯一性和条件必要性。
- 发布物:10,235 条单实体与多跳问题的求解轨迹,以及递归语言模型(RLM)框架——关键理念是「持久图状态」:把证据保存在上下文窗口之外,再按需选择性拉入。
「研究」频道最新
- 拆解 Gary Marcus 的逻辑:LLM 做数学为何仍是无解难题 — ryunuck · 2026-10-08
- temperature 设 0 也不稳定:千次生成竟出 80 种不同输出 — lmoroney · 2026-10-08
- 用预测市场训练LLM模拟个体行为,零样本迁移提升15.5分 — youjiaxuan · 2026-10-08
- FractAL 提出软策略选择,批式主动学习不再死守单一采集策略 — anshulkundaje · 2026-10-08
- DeLM 更新版实测:多智能体快 2.49 倍但评测口径各异 — jyangballin · 2026-10-08
- RAG 检索该不该做多样化?论文给出按查询自适应的判定规则 — _reachsumit · 2026-10-08