训练数据该过滤还是选择引发争论
围绕大模型训练数据预处理策略,社区爆发一场「过滤 vs 选择」的争论。@giffmana 提出应把问题重新框定为「数据选择」而非「数据过滤」:在通用模型场景下,随算力增加几乎所有数据都有用;简单的启发式过滤虽能剔除垃圾,也会误删高价值数据(如按日期命名的图片、看似无意义的文件名)。其引用的材料称,过度过滤可损失约 33% 的算力,因此除非算力受限或训练非通用模型,应避免「智能过滤」,转而用针对特定分布的选择器,关注训练数据分布、最大化多样性。
已确认
- @giffmana 明确主张区分「过滤」与「选择」两种范式,认为通用模型训练不应设过滤器,过滤是糟糕的质量控制手段
- 有引用数据称过度过滤会带来约 33% 的算力损失
- @codestar 反对将视觉领域结论推广到文本:文本数据中垃圾内容占比极高(如 90%),训练未过滤的 Common Crawl 原始数据不可行
- @codestar 认为对明显坏数据做「打地鼠」式移除是必须的
尚未确认
- 33% 算力损失的具体实验条件与出处未在帖内给出
- 90% 垃圾占比的统计口径不明
为什么重要
- 争论核心是通用能力与特定任务性能的取舍:过度过滤可能损害模型通用性,而不过滤在文本域几乎无法训练
- @codestar 提出过滤无效的另一种解释:评估集本身可能有严重问题,评估数据同样需要清洗,这为「过滤没用」的实验结果提供了诊断新角度
2026-08-22 ~ 2026-08-24 · 5 条相关
一手来源
- 过度过滤数据损失 33% 算力,选代替代过滤更优 — giffmana ·
- 数据清洗之争:文本训练中过滤策略的关键性 — code_star ·
- 【源头】过度过滤数据损失 33% 算力,选代替代过滤更优 — giffmana · 2026-08-22
- 数据选择优于过滤,通用模型训练不应设过滤器 — giffmana · 2026-08-23
- 技术观点:过滤是糟糕的质量控制,应关注训练数据分布 — giffmana · 2026-08-24
- 【源头】数据清洗之争:文本训练中过滤策略的关键性 — code_star · 2026-08-24
- 数据过滤无效?可能是评估集本身坏了 — code_star · 2026-08-24