Data Quality Assessments: A Theoretically Structured Overview of Approaches and Methods
Ralph Foorthuis
stat.OT, cs.DB, stat.ME
2026-08-23
Heineken的Foorthuis用评估逻辑与驱动源两轴,把数据质量评估整理成四类共15种方法;LLM因输出不可完全确定,被放进探索性分析象限。
数据质量差会拖垮报表、分析和模型,这点没人反对。难的是怎么评。现有综述要么停在完整性、一致性、准确性这类维度清单,要么下沉到「字符串长度检查」「外键分析」这类 SQL 级算法。DAMA 的知识体系面向干系人,也不给一张能拿来选方法的地图。
Heineken 数字与技术部门的 Ralph Foorthuis 要补的是中层分类:按什么逻辑评、由什么东西驱动评。读者不限于写校验规则的工程师,也包括要做数据质量审计或策略的人。
分类只用两根轴。
两轴交叉得到四个象限:
LLM 被放进第四象限,理由写得很干脆:底层训练算法是形式的,但带温度参数的生成输出谈不上可完全预测,而且对 prompt 敏感,所以不能算确定性规则。复杂 agent 如果去调形式化校验工具,那一段应算回规格校验或数据比对。
这是一篇分类论文,没有新的准确率数字,也没有拿这套类型学做过对照实验。能核对的产出是框架本身的覆盖:
| 象限 | 方法数 | 代表手段 |
| 规格校验 | 4 | schema、领域规则、分布检验、有监督异常检测 |
| 数据比对 | 3 | 跨库对值、digest、对照现实 |
| 感知校验 | 4 | 访谈、审阅、观察、问卷 |
| 探索分析 | 4 | 无监督异常、手工 EDA、profiling、LLM |
表 1 还标了方法能不能处理非结构化数据、能不能探索、要不要外部现实输入。大多数方法对结构化和非结构化都适用;纯 checksum 一类靠忽略数据模型来处理非结构化。
规格校验有同义反复的味道:先规定属性只能是 A 或 B,看见 C 就判错,结论几乎百分之百真,但长不出对新数据的理解。探索分析正好反过来,可以立刻上手,结果更不确定。肯尼亚医院那项混合方法研究被当作旁证:一种方法的发现能校正另一种。
对做模型的人,这张图的用处是别把数据质量理解成「再写几条 Great Expectations」。预训练和评测里常见的分布漂移、类别不平衡、代表性和噪声,论文明确放在规格校验的分布检验里;LLM 查缺漏文本、补值,则被放在探索象限,并写明仍要人盯着。
Heineken 作者的立场很实务:方法按「要做什么活」定义,不按「输出叫什么」定义,方便审计时按任务挑工具。若只论增量,这篇是给已有数据质量文献补了一张中层地图,没有新算法,也没有新基准。
作者承认类型学还没在经验场景里验证,后续要看不同方法怎么组合才能撑起一次完整审计。LLM 象限的位置也留了活口:以后的技术发展可能让部分 LLM 手段有资格进别的象限。
15 种方法的边界来自作者对文献的整理,论文没有报告检索策略、纳入排除标准,也没有统计每类方法的文献量。声称此前没有这样的理论化综述,证据是作者的阅读范围,不是系统综述。DAMA 七个常见维度被直接拿来当坐标系,维度之间的重叠只点到为止。对 AI 训练数据特有的问题(标注噪声、合成数据污染、评测集泄漏),这篇只在分布检验里点了一下代表性、不平衡、噪声和漂移,没有单独开类。