LSH-MinHash去重或致百万训练数据误删
rupspace · x · 2026-08-13
MBZUAI 研究指出,当前大模型预训练常用的 LSH-MinHash 去重方法可能会错误丢弃数百万份有效训练文档。
问题根源:该方法将重叠的重复桶视为传递等价,并在每个连通分量中仅保留一份文档,忽略了局部重叠并不等同于全局重复的特性。
「研究」频道最新
- NeurIPS 2026 征稿:探索非平稳环境下的 LLM 后训练 — jasondeanlee · 2026-08-13
- 学者激辩:持续学习的定义与评估指标究竟是什么? — shakoistsLog · 2026-08-13
- 用 LoRA 合并寻找最佳数据配比,大幅节省预训练算力 — pratyushmaini · 2026-08-13
- 利用多尺度优化解决奖励作弊:一种缩放不变的对齐思路 — jd_pressman · 2026-08-13
- 新基准 SRE-Bench:测试大模型逆向分析二进制文件能力 — teortaxesTex · 2026-08-13
- CoinRAG:复用 KV 缓存提升长文本 RAG 检索效率与准确度 — UCSantaBarbara · 2026-08-13