FinePhrase 入选 COLM 口头报告:万亿 Token 实验破解合成预训练数据设计
edwardbeeching · x · 2026-10-06
Hugging Face 等机构的 FinePhrase 研究入选 COLM 2026 Oral Spotlight,系统回答「如何合成高质量预训练数据」。
- 实验规模:生成超 1 万亿 token 的受控实验,系统比较改写策略、生成器模型与源数据等设计维度——此前这类系统比较是空白。
- 核心发现:结构化输出格式(表格、数学题、FAQ、教程)一致优于精选网页基线和既有合成方法;生成器模型超过 1B 参数后不再带来额外收益;原始数据的选择对性能影响显著。
- 产出:基于发现构建了 486B token 的开源改写数据集 FinePhrase,超越所有现有合成数据基线,生成成本降低最多 30 倍;数据集、全部 prompt 与生成框架均已开源。作者将于下周在 SF 做 Oral 报告与海报展示。
「研究」频道最新
- Schmidhuber 详解 1991 年位置编码:1/t 双曲时间衰减沿用至今 — SchmidhuberAI · 2026-10-06
- GDELT 用 Gemini 3 每日深度分析 75 国 150 语种电视新闻 — rseroter · 2026-10-06
- MIT 学者指出新量子 APSP 改进并未突破平凡 n^2.5 量子界 — aran_nayebi · 2026-10-06
- Meta AI 发 MIRA:拆分元推理器解决长程研究代理决策难题 — dair_ai · 2026-10-06
- llmClassificR 更新:纯 R 实现 LLM 文本分类全流程,无需 Python — GolinoHudson · 2026-10-06
- 神经科学界争论:为何记忆印迹研究缺乏低垂果实 — ShahabBakht · 2026-10-06