Ben Recht 讨论开放语料模型的边界与可复现性

beenwrekt · x · 2026-07-29

Ben Recht 认为,语言模型应该尽量保持开放,做到只要有训练语料、软件和算力,任何团队都能从头复现,因为这些模型本质上承载的是人类的集体知识与文化。

他接着讨论“开放语料”到底怎么定义。文中以 Ai2 的 OLMo 为例:其模型报告公开列出了预训练数据来源,包括 Wikipedia、Wikibooks、Common Crawl 抓取网页、arXiv 论文、带宽松许可证的 GitHub 代码,以及 FineMath 网页数据。早期的 Dolma 语料还包含 Reddit 讨论、Semantic Scholar 论文和 Project Gutenberg 公版书。

文章最有争议的部分在于:一些“开放”数据集本身也是由 LLM 参与生成或标注的。比如 FineMath 3 使用 Llama 做标注,后续 OLMo 的数学数据管线里还用了 Qwen。作者的核心观点是,“开放”不必追求纯度,而应看数据是否足够可获取、可复现,能否支持公众继续构建模型。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →