MIT与微软新论文揭示预训练数据协同效应

LesterMackey · x · 2026-08-05

机器学习的发展通常归功于模型规模和数据量的增加,但数据混合的成分同样关键。这篇来自 MIT 与微软研究院的论文提出并量化了语言模型预训练中的「数据协同效应」(data synergy)。

研究发现,不同领域数据的组合会产生非平凡交互(例如加入代码能提升数学推理,而某些混合会引发干扰降低性能)。研究团队利用不同开源 LLM 的预训练混合差异,估计了直接的领域到基准协同,以及需要多领域共现的二阶协同。该框架比领域无关的 Scaling Laws 具有更高的预测准确性,并通过在预测最优和最差混合比例下训练模型验证了其有效性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →