MIT与微软新论文揭示预训练数据协同效应
LesterMackey · x · 2026-08-05
机器学习的发展通常归功于模型规模和数据量的增加,但数据混合的成分同样关键。这篇来自 MIT 与微软研究院的论文提出并量化了语言模型预训练中的「数据协同效应」(data synergy)。
研究发现,不同领域数据的组合会产生非平凡交互(例如加入代码能提升数学推理,而某些混合会引发干扰降低性能)。研究团队利用不同开源 LLM 的预训练混合差异,估计了直接的领域到基准协同,以及需要多领域共现的二阶协同。该框架比领域无关的 Scaling Laws 具有更高的预测准确性,并通过在预测最优和最差混合比例下训练模型验证了其有效性。
「研究」频道最新
- Evo-Harness 论文:验证器比反思更能提升Agent能力 — solyarisoftware · 2026-08-26
- ColBERT 系列论文技术演进脉络梳理 — anshulkundaje · 2026-08-26
- 谷歌 ReasoningBank:从成败轨迹蒸馏策略,LLM 变自我进化智能体 — solyarisoftware · 2026-08-26
- AME 训练效率提升 5 倍,新方法支持大规模地图扩展 — ChongZzZhang · 2026-08-26
- 用星系图研究LLM:概念按难度顺序涌现 — UniverseTBD · 2026-08-26
- 研究揭示 Python str.lower() 可能引发安全漏洞 — jedisct1 · 2026-08-26