一套让知识图谱保持干净的实体归一化流程
Roger_M_Taylor · x · 2026-07-24
这张图讲的是一套 知识图谱实体归一化与去重流程,核心不是“抽取”,而是如何把抽出来的实体整理干净。
- 先从文档切块,再用 LLM 抽取实体与关系。
- 对每个实体做三层匹配:精确匹配、模糊匹配、语义匹配。
- 匹配后决定是否复用 canonical name;不匹配就保留新名字。
- 去重阶段再做 embedding、语义搜索和模糊搜索,并按阈值分流:
- >= 0.95:直接合并
- 0.85–0.95:进入人工审核
- <= 0.85:新建节点
作者强调,实体归一化 和 去重 不是同一个问题,不能混为一谈;宁可多拆一些节点,也不要把不同实体误合并。
「研究」频道最新
- Robocurve 要给机器人做真实世界物理任务基准 — garrytan · 2026-07-24
- AI 周报汇总:企业采用、长时程安全与 Kimi K3 — burkov · 2026-07-24
- PyTorch:合成训练数据可帮助训练量子纠错解码器 — PyTorch · 2026-07-24
- Eterna 推出 RNA 结构设计挑战,人类专家正面对决 GenAI — chaitjo · 2026-07-24
- Reddit 讨论用 Blender 稳定 AI 视频关键帧的一致性流程 — Alone-Performer5065 · 2026-07-24
- 有人想把人类随机行为做成长期数据集来研究 — PleasantLow670 · 2026-07-24