团队发布 440 亿合成 token 预训练数据
vanstriendaniel · x · 2026-07-21
团队发布 440 亿 token 合成数据,强调预训练质量
帖子宣布公开了一批通过 CoT-guided rewriting 生成的 440 亿个合成 token。
核心信息
- 作者声称,这批数据比平均的人工网页文本拥有更高的预训练质量。
- 这次同步放出了 数据集 和 论文。
- 论文已被 COLM 2025 接收。
这项工作的重点
- 目标不是单纯扩数据规模,而是提升 pretraining data quality。
- 说明合成文本如果经过推理引导与重写,可能比原始网页语料更适合训练模型。
「研究」频道最新
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机 — OpenAI · 2026-07-22
- NVIDIA:先调好 Harness,再去调模型 — NVIDIAAI · 2026-07-22
- AI 发展的瓶颈:从互联网数据红利到高质量反馈闭环 — dyamins · 2026-07-22
- NVIDIA 公布 22 篇 SIGGRAPH 论文与机器人仿真工具 — facontidavide · 2026-07-22
- 不用图数据库构建知识图谱,成本比GraphRAG低1000倍 — TheRedfather · 2026-07-22