0.6B 小模型替换规则清洗栈,预训练 DCLM 分数提升 4.7%
XiongChenyan · x · 2026-09-30
- CMU 团队(Chenyan Xiong 组)发布 ReScraper:一个仅 0.6B 参数的统一语言模型,用单个模型替换传统「启发式抓取 + 数十条规则过滤器」的预训练数据清洗栈。
- 模型从三个教师模型的输出中学习监督数据,先从原始 HTML 抽取正文,再对每页执行四种操作之一:保留、删改噪声行/片段、整体删除、或对「写得差但有信息量」的页面重写。
- 在相同爬取数据池上,用其清洗数据预训练 400M/1.4B/2.8B 模型,DCLM Core 相对最强基线(含昂贵的多智能体数据筛选)提升 3.8–4.7%。
- 分析显示四种操作各自互补,单模型一体化抽取+清洗优于多模型级联,且操作集中于低质页面、提升最大,同时保持语料多样性。论文、模型、数据、代码均已开源。
「Infra」频道最新
- 马斯克对话黄仁勋:电力即 GDP,SpaceX 拟建 10GW 算力、瞄准轨道计算 — tctjr · 2026-09-30
- Ben Lorica:AI 数据问题正转向下游——信息不缺,可用性才是瓶颈 — bigdata · 2026-09-30
- WhiteMatter:跨层共享 KV 让各层读取任意深度,省一半缓存不降性能 — INK-USC · 2026-09-30
- 1.375 bits/权重的 3:4 三值格式跑进浏览器:1.6MB 模型打平 7.8MB int8 — Brilliant-Hall1387 · 2026-09-30
- 本地跑 27B 模型多难?24GB 显存几乎刚好,16GB 显卡更普遍 — draginol · 2026-09-30
- Linux 7.4 驱动让 AMD Radeon 核显 AI/LLM 性能提升 18-23% — Fcking_Chuck · 2026-09-30