哈佛与 MIT 新研究:数据重复利用正引发 LLM 训练边际效益递减

burkov · x · 2026-08-13

当前 LLM 训练正面临一个转折点:寻找高质量新文本的难度已超过单纯增加算力的难度。而传统的“缩放定律”通常假设新数据能随算力同步增长。

哈佛大学与麻省理工学院的联合预印本研究了更现实的情况:在固定数据集上补充重复或改写的文本。研究引入了一个新指标,用于衡量这些衍生数据相对于全新数据的价值。

实验表明,重复数据的价值并非固定不变:随着其比例增加,带来的训练收益会逐渐递减。这揭示了未来模型训练将受限于算力、新数据和数据重复利用效率的多重制约。

所属事件:哈佛与MIT研究:预训练数据重复浪费33%算力(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →