过度过滤数据损失 33% 算力,选代替代过滤更优
giffmana · x · 2026-08-22
针对训练数据过滤问题,作者提出应区分“过滤”与“选择”。简单的启发式过滤(如文件名规则)虽剔除垃圾但也误删高价值数据(如按日期命名的图片),导致算力浪费。建议在算力受限或非通用模型场景下,采用数据选择策略,而非粗暴过滤。引用者补充指出,精过滤的价值正让位于重要性加权与源数据重述。
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24