Marin 535B 训练揭秘:152 个数据集 25T token 如何整合到一起
jyangballin · x · 2026-09-24
Marin 团队成员 William Barr Held 发布长线程,讲解开源训练数据的整合工程——从 Hugging Face 上下载数据到训练模型之间的全部工作。
- Marin 的 535B token 训练运行基于来自 152 个数据集、共 25T token 的可商用许可数据
- 内容涵盖数据下载、清洗、去重、格式统一等让海量开放数据集「协同工作」的完整流程
- 对做开源预训练数据管线的团队是系统性参考
「研究」频道最新
- 新论文 Beyond Repeated Sampling:用学习概念提升测试时推理效率 — rbhar90 · 2026-09-24
- CoRL 2026 将办「从纠正与干预中学习」工作坊,已开放征稿 — ebiyik_ · 2026-09-24
- Claude 发现新酶系统很酷,但实验仅到大肠杆菌表达一步 — iScienceLuvr · 2026-09-24
- 用 Jev 做奖励模型跑 RL,24 步把 AI 味奖励从 0.58 提到 0.76 — sophiamyang · 2026-09-24
- 前沿 AI 实验室一周医疗动态:Opus 5.5 降价 40% 与 AI 生物学突破 — HealthcareAIGuy · 2026-09-24
- Luxar 开源发布:任意维度数据集一个链接在浏览器打开 — alxndrkalinin · 2026-09-24