数据选择优于过滤,通用模型训练不应设过滤器
giffmana · x · 2026-08-23
关于训练数据处理的讨论指出,应将问题框架化为“数据选择”而非“数据过滤”。在通用模型场景下,随着算力增加,几乎所有数据都有用;但在特定实际用例中,针对特定分布的“选择器”比通用的过滤器更有效。除非算力受限或不需要通用模型,否则应避免使用“智能”过滤器,而应采用选择策略。
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24