Epiplexity Guided Data Selection and Generation for Out-of-Distribution Generalization
Ellen Su, Andres Potapczynski, Shikai Qiu, Edward Hughes, Andrew Gordon Wilson
cs.LG, cs.CL
2026-08-12
NYU 提出 Epiplexity 指标衡量数据结构信息量,用它做数据选择与合成数据生成,双双跑赢 SOTA 方法。
现有数据选择方法(DoReMi、ADO 等)靠试验证明哪批数据能提升下游表现,但都没回答一个更底层的问题:什么样的数据本身就更容易泛化到训练时没见过的任务?论文的假设是,包含更多「结构信息」的数据更可能被模型学成可复用的电路和子程序,从而迁移到新场景。作者借用最近提出的 epiplexity 概念(用受计算约束的学习者能从数据中提取多少结构信息来定义),把它变成可以在训练过程中实时估计的信号,分别用于挑选预训练数据域和生成合成数据。
Epiplexity 的直觉估计很简单:训练损失曲线下方、高于模型最终损失那部分的面积,就是这批数据教会模型的「结构信息量」。太容易学的数据(重复序列)损失很快归零,没有面积;学不会的数据(纯噪声)损失一直不降,同样没有信息量;只有让模型持续、显著降损失的数据,才是高 epiplexity。
论文给出两条应用路径:
两条路径都跑赢了现有方法。
| 设置 | 方法 | 结果 |
| Pile 数据选择(124M/1.3B 模型,10 个零样本任务) | EpiSelect vs Natural(无选择) | 0.394 vs 0.377 / 0.431 vs 0.422 |
| Pile 数据选择 | EpiSelect vs ADO(此前 SOTA) | 0.394 vs 0.379 / 0.431 vs 0.425 |
| GPT-2 合成数据微调 GLUE 七项任务平均分 | EpiGen vs Pretrained 基线 | 0.770 vs 0.743(+2.7 分) |
| 合成+真实数据混合(OOD GLUE) | 50% 合成 + 50% OWT | 约 0.764,高于纯合成(0.752)和纯真实(0.757) |
EpiSelect 在 124M 和 1.3B 两种模型规模下都在 10 个任务里拿到 6 个最优。作者还发现一个旁证:在跨域相互影响矩阵里,一个域的 token 对自己域损失的贡献远大于对其他域的贡献(对角占优),说明大部分结构信息是域内特有的,不太能跨域复用,这和直觉一致。
有一个基准数据集层面的坑:在经典的 Pile 数据集上,由于 PileCC(通用网页文本)占了 41% 的 token,单独只训 PileCC 这一个域反而比任何精心设计的课程学习方法都强,这让 Pile 失去了区分数据选择方法优劣的能力。作者因此转向覆盖更均衡的 Common Pile(8TB、30 个来源)重新做实验。
合成数据部分,epiplexity 引导的生成器带来的提升只有在生成器和学习者都用预训练权重初始化时才出现;把两者换成随机初始化,GLUE 平均分几乎不变(0.743→0.740),说明这个方法放大的是预训练模型已有的能力,不是凭空造出信号。
对做预训练数据配方的团队,这提供了一种不需要额外训练代理模型、不需要人工设定课程规则的在线数据选择信号,直接在真实训练过程中计算,没有离线搜索开销。对做合成数据的团队,这是第一个不依赖外部验证器(比如代码执行器、数学检验器)就能给纯生成的合成数据打分的机制,这类无验证器场景此前基本是空白。目前的验证规模都在 124M–1.3B 之间,能不能带到主流训练规模(几十亿到上百亿参数)还没有答案。
论文自己承认三点:一是所有实验都在小模型上做的,规模效应没验证;二是选择和生成两条路径用的都是 epiplexity 的一个「可估计代理」(prequential coding estimate),不是真正的 epiplexity 定义,代理和原始量之间的偏差有多大没有理论保证;三是目前只针对单模态、单目标场景,多模态和多目标生成留给未来工作。核心因果证据主要来自相关性(域间 epiplexity 和 OOD 准确率的 Pearson r=0.88),不是控制实验意义上的因果验证,不过作者用权重范数作为对照(r=0.01,不显著)排除了「泛化只是因为模型学得更充分」这种混淆解释。