500 万份法院判决如何低成本抽实体关系?作者公开求解

SignificantZebra5883 · reddit · 2026-09-22

作者要处理约 500 万份波兰公开法院判决,抽取当事人、诉求、判决、金额、关系等结构化图谱并做统计。13 份文档的试点已产出 160 种实体类型字符串(90 种只出现一次),涵盖抽象法律概念与程序事件;试过 2 万字符的「上帝 schema」但判决太多样行不通,斯洛伐克语屈折变化又加剧命名不一致。其候选方案是小型实体抽取器 + 微调关系分类器分窗口决策,此前用 Jina embedding 找近邻候选、LLM 判断合并效果尚可,但担心处理 25 万份后才发现设计错误要全部重跑,向社区征求训练与概念归一化经验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →