团队发布 440 亿合成 token 预训练数据
vanstriendaniel · x · 2026-07-21
团队发布 440 亿 token 合成数据,强调预训练质量
帖子宣布公开了一批通过 CoT-guided rewriting 生成的 440 亿个合成 token。
核心信息
- 作者声称,这批数据比平均的人工网页文本拥有更高的预训练质量。
- 这次同步放出了 数据集 和 论文。
- 论文已被 COLM 2025 接收。
这项工作的重点
- 目标不是单纯扩数据规模,而是提升 pretraining data quality。
- 说明合成文本如果经过推理引导与重写,可能比原始网页语料更适合训练模型。
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11