哈佛与 MIT 新研究:数据重复利用正引发 LLM 训练边际效益递减
burkov · x · 2026-08-13
当前 LLM 训练正面临一个转折点:寻找高质量新文本的难度已超过单纯增加算力的难度。而传统的“缩放定律”通常假设新数据能随算力同步增长。
哈佛大学与麻省理工学院的联合预印本研究了更现实的情况:在固定数据集上补充重复或改写的文本。研究引入了一个新指标,用于衡量这些衍生数据相对于全新数据的价值。
实验表明,重复数据的价值并非固定不变:随着其比例增加,带来的训练收益会逐渐递减。这揭示了未来模型训练将受限于算力、新数据和数据重复利用效率的多重制约。
所属事件:哈佛与MIT研究:预训练数据重复浪费33%算力(3 条相关)→
「研究」频道最新
- AI攻克Epoch AI第4题:成功构造2000阶哈达玛矩阵 — burny_tech · 2026-08-13
- 哈佛大学宣布举办多模态基因组与AI会议 — Miles_Brundage · 2026-08-13
- Bridge编辑技术登上《科学》:能向人类基因组精准写入大片段DNA — chaitjo · 2026-08-13
- 无需 GPU 和 LiDAR:Autoware 开源端到端 L2 自动驾驶栈 — 4310sy · 2026-08-13
- 爱犬绝症主人用 ChatGPT 研发 mRNA 疫苗,创立 Gamgee — DeryaTR_ · 2026-08-13
- Hamel Husain 总结 13 场 AI 工程讲座:检索、后训练与评估要点 — HamelHusain · 2026-08-13