斯坦福开源 Marin 535B 训练数据整合全过程
斯坦福 Marin 团队成员 William Barr Held 发布长线程,揭秘 535B 模型的开源训练数据整合工程,讲解从 Hugging Face 下载数据到实际训练之间的全部工作。据 Percy Liang 介绍,该训练基于 25T tokens,全部来自 Hugging Face 上 152 个许可数据集,经过清洗整合而成,展现了大规模开源数据工程的完整流程。
2026-09-24 ~ 2026-09-24 · 2 条相关
- Marin 535B 训练揭秘:152 个数据集 25T token 如何整合到一起 — jyangballin · 2026-09-24
- Stanford Marin 535B 训练:从 HF 上 152 个数据集清洗出 25T token — anshulkundaje · 2026-09-24