开发者把整站 arXiv 打包成 16TB 开放数据集
9 月 20 日,开发者 secemp9 在 Hugging Face 发布数据集 secemp9/arxiv-complete,把整个 arXiv 网站做成公开数据集。这是目前少见的 arXiv 全量、全版本、多格式公开镜像,对需要大规模论文语料的研究者和开发者值得关注,但项目由个人自掏腰包维护,可持续性取决于社区支持。
已确认
- 数据集包含 3,148,796 篇论文,覆盖每一个版本(含历史版本),总计约 16TB
- 提供 LaTeX 源文件、PDF、PostScript 和 HTML 多种格式
- 托管成本每月约 249 美元,年烧约 3000 美元;此前从 AWS 拉取数据还产生约 626 美元的出口流量费
- secemp9 发现 arXiv 官方 S3 桶并不完整,需要借助 GCS 等其他来源补齐数据
为什么重要
- 全量、全版本、多格式的公开 arXiv 数据集可显著降低研究者获取和复现论文语料的门槛
- 独立开发者个人承担带宽与存储成本,长期维护依赖社区支持,他已公开捐赠页寻求援助
2026-09-20 ~ 2026-09-20 · 6 条相关
一手来源
- 整站 arXiv 搬上 Hugging Face:314 万篇论文 16TB 全格式 — secemp9 ·
- 镜像 arXiv 数据集年烧 3000 美元,独立开发者开捐赠页求援助 — secemp9 ·
- 【源头】整站 arXiv 搬上 Hugging Face:314 万篇论文 16TB 全格式 — secemp9 · 2026-09-20
- 全 arXiv 数据集上线 HuggingFace:314 万篇论文共 16TB — secemp9 · 2026-09-20
- 【源头】镜像 arXiv 数据集年烧 3000 美元,独立开发者开捐赠页求援助 — secemp9 · 2026-09-20
另有 3 条近重复转述:secemp9 · MaziyarPanahi · MaziyarPanahi