训练数据该过滤还是选择引发争论

围绕大模型训练数据预处理策略,社区爆发一场「过滤 vs 选择」的争论。@giffmana 提出应把问题重新框定为「数据选择」而非「数据过滤」:在通用模型场景下,随算力增加几乎所有数据都有用;简单的启发式过滤虽能剔除垃圾,也会误删高价值数据(如按日期命名的图片、看似无意义的文件名)。其引用的材料称,过度过滤可损失约 33% 的算力,因此除非算力受限或训练非通用模型,应避免「智能过滤」,转而用针对特定分布的选择器,关注训练数据分布、最大化多样性。

已确认

尚未确认

为什么重要

2026-08-22 ~ 2026-08-24 · 5 条相关

一手来源