DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang
cs.LG, cs.CL
2026-05-19
首个统一评测训练数据准备的基准,分构造与质量评估两条赛道;发现合成领域数据掺进指令集下游经常不升反降,并发布跨模型最准的质量打分器 DAS。
训练数据决定大模型的能力上限,可「LLM 当数据准备员」这件事一直没法量化。各家做数据合成、做质量打分的方法用的是不同的数据源、基座模型和下游评测,比出来的结论没法互通。A 说自己的合成方法好,B 说自己的打分准,谁也没在同一个考场里考过。
这篇把问题拆成两个能力:数据构造(把原始材料变成监督训练数据)和数据质量评估(在真正训练之前,预测一份候选数据集到底有多少训练价值)。这里说的「质量」不是文本通不通顺,而是「喂下去之后下游涨不涨点」,即下游训练效用。两条赛道此前各做各的,DataPrep-Bench 是第一个在同一个下游协议下同时评两者的基准。
六大赛道:通用文本、数学、科学、医学、金融、法律。原始语料是各领域的书和长文本(来自 Wikibooks、FreeBookCentre、Open Textbook Library),用 MinerU 转成 Markdown。
数据构造赛道:每个方法拿到同样的原始语料,产出一批监督数据;评分方式是把它和一份共享的指令跟随语料 Dolly-15k 一起微调进基座模型,再在领域的留出测试集上打分。基座是 Qwen2.5-7B 和 Llama-3.1-8B。所有方法都拼在 Dolly 上比,相当于逼方法证明自己那份数据真的有用,而不是单纯比谁产的数据多。
数据质量评估赛道:每个领域准备一个候选池(8 到 14 份公开 SFT 语料,混了领域内和领域外,比如 OpenR1-Math-220k、UltraChat、Tulu 3、MegaScience、UltraMedical)。打分函数给每份数据打一个标量分,这个函数的好坏用「分数和真实下游表现的皮尔逊相关」来衡量。相关越高,说明它越能提前预测哪份数据值得训。
作者自己贡献了两个方法。Data-Construction-Skill 是个技能驱动的 agent,把「什么算合格监督」这件事从 prompt 里抽出来,放进一个可复用的技能层(含任务指令、输出 schema、过滤规则、校验工具);agent 据此从语料里抽取知识命题,生成概念题、推理题、案例题三类 QA。DAS(Distributional Alignment Score) 是质量评估侧的方法,想法来自域适应理论:训练数据和目标分布对齐得好,下游就稳。它用一个固定编码器把数据集编码到特征空间,再用 MMD(最大均值差异,衡量两个分布差多远的指标)算候选数据集和一个高质量领域代理数据集的距离,距离越小分越高。
最反直觉的一条:把合成的领域数据拼到 Dolly-15k 上,下游经常不升反降。Dolly-only 这个最朴素的基线,在不少领域里压过一堆花哨的合成方法。
| 设置(Qwen2.5-7B 数学) | GSM8K | AIME24 | 均分 |
| Dolly-only | 69.9 | 0.0 | 23.6 |
| 最强 agent(Qwen3.5-Plus) | 72.7 | 3.3 | 25.2 |
| DataFlow-Skill | — | — | 19.0 |
方法之间也分得挺清楚:DataFlow 这类结构化流水线在金融、法律强;纯 agent 在数学、医学这种重推理的领域领先;技能驱动的 Data-Construction-Skill 在知识抽取密集的领域拿下最强。在 Llama-3.1-8B 金融上,它(用 Claude Opus 4.6 跑)把均分从 Dolly-only 的 15.1 拉到 34.2,绝对涨了将近 20 分。
质量评估这边,DAS 是唯一一个在数学、科学、医学三个领域同时把皮尔逊相关顶过 0.70 的打分器。
| 领域(三模型均) | DAS | Qurating-Expertise |
| 数学 | 0.86 | 0.69 |
| 科学 | 0.72 | 0.72 |
| 医学 | 0.71 | 0.68 |
作为对照,BERTVendi 这类多样性指标在数学上只有 0.28,多数领域连 0.30 都到不了。代价是慢:DAS 算一份要 306 秒,质量类指标只要 0.03 到 85 秒。但能提前预测哪份值得训,比训完才发现没用便宜得多。
对做预训练、后训练数据的人来说,这篇给了一个能复用的考场和两个能直接用的方法。最实用的提醒是:别默认合成数据有用,加之前先用 DAS 之类打分器筛一道,可能省掉一堆无效训练。技能驱动那条路线把数据规范从 prompt 里挪到可复用技能层,对工程化落地有意义,技能可以版本化、可以审计、可以换模型跑。
但也要看清,这是一份方法学和测量学的工作,不是刷榜的模型。它的价值在于把一个此前各说各话的领域统一到一把尺子下。
作者自己承认几个硬伤。候选池太小:金融、法律、医学每个领域只有 8 到 10 份候选,统计功效弱。技能驱动构造在医学、法律上跑不过最强 agent,在科学上两个基座下都跑不过 Dolly-only 基线。DAS 对基座有依赖,在某个基座的科学上相关性掉到不显著。
更存疑的是金融和法律。作者自己说「对所有测过的打分器都还很难」,可 DAS 在表里又拿了最强相关,说明这两个领域的「最强」可能也只是矮子里拔将军,结论要打折看。另外 DAS 依赖领域代理数据集选得好不好,论文用的是 Infinity-Instruct、ODA-Math-460k 这类公认高质量集,换到没有现成代理的领域,这套方法能不能复现同样的相关,没有验证。