数据清洗之争:文本训练中过滤策略的关键性
code_star · x · 2026-08-24
针对数据过滤的有效性,作者反驳了视觉领域的观点,指出文本数据中垃圾内容占比极高(如 90%),训练未经过滤的 Common Crawl 原始数据不可行。作者认为 "打地鼠" 式地移除明显坏数据是必须的,并指出如果过滤无效,往往是因为评估集本身存在问题,也需要清洗。
「Infra」频道最新
- Cursor 团队 Git 大作获赞:无状态存储将重写基础设施 — thesephist · 2026-08-24
- AI 性能工程资源清单 v2 发布:从单次推理到 MoE serving 全覆盖 — AccBalanced · 2026-08-24
- 韩国半导体工程师地位超越医生,家长意愿成风向标 — SuB8u · 2026-08-24
- 现代编程的“VendorOps”困局 — vboykis · 2026-08-24
- 本地开发高效且可控,何必一味依赖云端 — vboykis · 2026-08-24
- 在 PrimeIntellect 训练,用 Modal 渲染 rollout — willcb · 2026-08-24