企业问答的暗物质:EntLORE 发现三成问题答案根本不在文档里

ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering

Akrin Zheng, Alexander Wu, Alaia Liu

cs.IR, cs.AI, cs.CL

2026-08-11

ScitiX 用真实企业的审计真相图构造企业问答基准:2341 份文档、907 题,其中 L3 潜在组织推理题的目标关系在所有文档里都不存在,结果 GraphRAG 平均最高也只有 36.2%,给金文档仍有 30.4% 答不出。

这篇在解决什么

企业问答通常被当成检索问题:找到相关内部文档,生成有据答案。但企业文档是干活的副产品,不是为问答写的。一个工程师在哪项目上,可能一份周报写他做了某模块,另几份文档把模块放进某项目的工作语境,而「他属于这个项目」这句话在任何文档里都找不到,只能靠组织规则推导出来。论文管这叫潜在组织推理。

现有基准测不到它,因为构造方法反着来:先定一条答案路径,再沿路生成文档,模型要做的只是把已陈述的事实拼起来。真实企业里没有这种现成链条,而且一个自然的信息需求可能根本不可回答(前提私有、覆盖不全、多义)。EntLORE 换了个方向:先重建一个经过审计的企业世界,再从这个世界里编译问题。

方法

管线四段。从例行文档、权威组织表、操作日志重建一个带出处的原始图,节点是人、项目、模块、活动、系统、客户,边分三类:原生关系(有文档或日志出处)、元数据关系(来自权威记录)、启发关联(只用于出难题与造干扰项,不单独定金标准)。一个版本化的组织惯例库生成候选推理边,比如包含转移规则把模块级活动归因到父项目;每条保留的边记录生成规则、依赖链与人工授权判定,构成真相图。匿名化映射把文档一致改名改日期后发布,真相图、惯例库、目标边全部扣下。最后每道题由类型化图算子从真相图采样并执行,算出答案、证明依赖与关联证据单元,语言模型只负责把图程序写成员工口吻的问题,拿不到金答案。

三级难度按目标关系在发布语料里的形态分:L1 答案在一份文档里明说;L2 跨多文档陈述后组合;L3 目标关系任何发布文档都没写,只在真相图里被认证,必须从散布的观察中恢复。发布前验证查四件事:图程序返回有效派生、集合答案在闭包下完备、程序语义唯一、L3 题在发布语料全别名扫描下确实缺席。前提必须用到私有信息的问题进弃答库。

这个设计的要害:benchmark 持有真相但不发真相,被测系统只见文档,答案可验证又不可抄。

结果

907 题(469 L1、204 L2、234 L3)配 2341 份文档、1153 实体 3784 条类型化关系,8 个模型乘 7 种访问方式共 56 个配置。L3 上的平均正确率:

访问方式L1L2L3
GraphRAG(语料诱导)63.245.336.2
BM2562.451.434.0
LLM Wiki61.752.527.7
Flat RAG46.132.518.9
Agentic 检索48.535.613.5
金文档 oracle87.493.869.6

三个结论值得展开。结构化访问领先但不稳:GraphRAG 平均最高,可逐模型看只赢五个,BM25 赢三个,且差距集中在特定关系族,部门归因上 GraphRAG 到 53% 对 BM25 的 2%,包含归因与层级汇总则所有可部署方法都不超 34%。稠密检索全面溃败:BM25 比 Flat RAG 在三级上分别高 16.2、18.9、15.1 点,差距七成来自文档组装环节,词法匹配吃到项目别名、模块名、工单术语这些稀疏组织锚点,稠密嵌入反而丢。同一稠密底座上 agentic 迭代检索(13.5)比单趟 Flat RAG(18.9)还低,但给它金文档路径它就冲到 69.6,说明循环本身会用证据,是稠密后端取证据不行。最扎心的是金文档残差:L1 剩 12.6%、L2 剩 6.2%,L3 剩 30.4%,L3 残差是 L2 的 4.9 倍,占最佳可部署条件剩余错误的 47.7%。拿不到答案时的行为也分野:零分的 L3 里 BM25 有 53% 明说语料中没有此信息,GraphRAG 只有 6%。

发布保真度做了对照:176 道可反向渲染的题在私有世界与匿名世界跑同一模型,组级结构(oracle 前三、可部署在后)迁移,但可部署条件间的细排序不迁移,偏差集中在 BM25 与 GraphRAG,与词法对匿名加翻译语料的敏感一致。作者据此自我限定:组级比较可信,细排名存疑。

为什么重要

对企业 RAG 落地,这份数据解释了很多「检索做对了还是答不对」的现场体感:问题不在召回,在组织关系没有显式可用。落地启示很具体,稀疏锚点比稠密嵌入更贴企业语料;把组织结构物化成图或 wiki 的离线编译,比在查询时加 agent 循环有效;系统该把「文档背后的组织」当一等推理对象,并且在推不出关系时诚心弃答。基准代码与数据开源,truth-graph-held-private 的构造方式对其他领域(医疗、法务的组织化知识)可复制。

局限与存疑

单一企业、单一惯例库,L3 的 234 题分到五个关系族后每族样本量不大(部门归因 42 题),族级结论的统计力有限。组织惯例(如包含转移)由该企业人工授权认证,换企业规则不同,结论的外推性未讨论。匿名化加翻译破坏了细排序,论文自己承认细排名不可信,这意味着表里 GraphRAG 与 BM25 的两三分差距未必是真实差。金文档残差不是纯推导失败度量,还混着导航、交互与提示效应,30.4% 是上界。评判用单一固定 judge 盲评,自由文本答案的原子声明拆分依赖裁判稳定性,附录虽给了复验但主表仍是单裁判。agentic 检索的迭代上限 30 次、40 万 token、900 秒,预算更宽时是否翻盘没有测。

术语

原文与代码

相关论文

全部论文解读