Stanford Marin 535B 训练:从 HF 上 152 个数据集清洗出 25T token
anshulkundaje · x · 2026-09-24
- Percy Liang(Stanford)介绍 Marin 项目的开源数据工作:535B run 基于 25T tokens,来自 Hugging Face 上 152 个许可允许训练的数据集。
- 团队为此构建了可扩展的基础设施,对 HF 上的开源数据执行下载、去重(dedup)、去污染(decontamination)与混合配比,产出可用于训练的 25T tokens。
- 帖子附完整技术推文串,讲解从下载数据到训练模型之间的全部工作流程,体现 Marin 对开放社区数据的理念。
所属事件:斯坦福开源 Marin 535B 训练数据整合全过程(2 条相关)→
「Infra」频道最新
- 哥伦比亚大学 CUbiC 论文探讨边缘到云 AI 基础设施与 CPO 路线 — jwt0625 · 2026-09-24
- Meta 发布 Muse 实时数字人:语音视频同步,响应不到一秒 — Scobleizer · 2026-09-24
- Alchemy 为状态存储加 Cloudflare Access 保护,支持 CI 服务令牌 — samgoodwin89 · 2026-09-24
- 一条 prompt 让 agent 自己核算账单:价格涨还是用量涨? — gethackteam · 2026-09-24
- 内核启动 50μs 延迟的代价:通用推理框架难以复刻单模型专有优化 — AlpinDale · 2026-09-24
- 腾讯混元扩展 critical-batch-size 理论:GRPO 训练提速 29%,PPO 生成吞吐达 2.29× — TencentHunyuan · 2026-09-24