500 万份法院判决如何低成本抽实体关系?作者公开求解
SignificantZebra5883 · reddit · 2026-09-22
作者要处理约 500 万份波兰公开法院判决,抽取当事人、诉求、判决、金额、关系等结构化图谱并做统计。13 份文档的试点已产出 160 种实体类型字符串(90 种只出现一次),涵盖抽象法律概念与程序事件;试过 2 万字符的「上帝 schema」但判决太多样行不通,斯洛伐克语屈折变化又加剧命名不一致。其候选方案是小型实体抽取器 + 微调关系分类器分窗口决策,此前用 Jina embedding 找近邻候选、LLM 判断合并效果尚可,但担心处理 25 万份后才发现设计错误要全部重跑,向社区征求训练与概念归一化经验。
「研究」频道最新
- 免推理 SPLADE 检索:查询延迟降到 BM25 水平的做法 — qdrant_engine · 2026-09-22
- 显微镜分辨率过高反而害了 CNN,U-Net 降采样 4 倍分割更准 — bravo_abad · 2026-09-22
- Reddit 研究解释 Kimi Delta Attention 表达力,提出扩展门控范围的 Complex KDA — Yossarian_1234 · 2026-09-22
- OpenAI 纳维-斯托克斯证明被指钻了题设漏洞 — joshgans · 2026-09-22
- LuaJIT UDF 把 LLM 决策读出嵌进 DuckDB:零 token 概率分类进 SQL — Shoddy_Telephone9702 · 2026-09-22
- 论文:LLM 主体入市场难收敛,资源配置效率低于人类 — WillRinehart · 2026-09-22