数据重复浪费算力,EMNLP 论文揭示数据配比实验不可扩展
MarekRei · x · 2026-09-05
- 论文《Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them》入选 EMNLP2026(布达佩斯)。
- 研究在数据受限(data-constrained)训练场景下,数据集重复(dataset repetitions)如何影响最优数据配比(data mixing),指出传统数据混合实验结论在规模化时因重复数据而失真,并提出修复方案。
- 作者 kevinzhou497 附有推文线程展开细节。
「研究」频道最新
- NEAR AI Lean agent 全解 Putnam Bench,成本仅为次便宜方案的 1/250 — lukaszkaiser · 2026-09-06
- KV缓存原理详解:LLM推理中为何重要且常被误解 — techNmak · 2026-09-06
- AI 用 48 小时写 2 万行 Lean 代码,攻克 98 年未解的数学难题 — 量子位 · 2026-09-06
- 「认知地图作为思维媒介」新文分享 — abenitezburraco · 2026-09-06
- Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸 — solyarisoftware · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06