Marin开源23万亿token预训练数据,可公开下载
joecole · x · 2026-08-22
斯坦福的Marin模型预训练数据现已公开,包含约23万亿token,可通过S3存储桶下载。该数据集的组成、架构、基础设施和内核细节均在GitHub上公开,训练过程可在wandb上实时观看。Marin团队表示,这次运行是数据、架构、基础设施和内核协同合作的成果。
「Infra」频道最新
- SGLang 推出权重缓存守护进程,万卡模型重启加速 16 倍 — xiaosun86 · 2026-08-22
- Agent 循环致上下文膨胀,5% 故障耗掉 25% 成本 — MaverikSh · 2026-08-22
- llama.cpp 发布 v0.2.0,转向语义化版本管理 — PhilippeEiffel · 2026-08-22
- 开源工具 Mark Cleaner:本地移除 AI 文本隐形水印与元数据 — VraserX · 2026-08-22
- 预训练数据重复浪费算力?ICML论文揭示大模型更耐重复 — heghbalz · 2026-08-22
- James Long 领悟 Sandbox 用例:关键在于无限算力而非安全 — Vjeux · 2026-08-22