数据清洗之争:文本训练中过滤策略的关键性

code_star · x · 2026-08-24

针对数据过滤的有效性,作者反驳了视觉领域的观点,指出文本数据中垃圾内容占比极高(如 90%),训练未经过滤的 Common Crawl 原始数据不可行。作者认为 "打地鼠" 式地移除明显坏数据是必须的,并指出如果过滤无效,往往是因为评估集本身存在问题,也需要清洗。

所属事件:训练数据该过滤还是选择引发争论(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →