Ben Recht 讨论开放语料模型的边界与可复现性
beenwrekt · x · 2026-07-29
Ben Recht 认为,语言模型应该尽量保持开放,做到只要有训练语料、软件和算力,任何团队都能从头复现,因为这些模型本质上承载的是人类的集体知识与文化。
他接着讨论“开放语料”到底怎么定义。文中以 Ai2 的 OLMo 为例:其模型报告公开列出了预训练数据来源,包括 Wikipedia、Wikibooks、Common Crawl 抓取网页、arXiv 论文、带宽松许可证的 GitHub 代码,以及 FineMath 网页数据。早期的 Dolma 语料还包含 Reddit 讨论、Semantic Scholar 论文和 Project Gutenberg 公版书。
文章最有争议的部分在于:一些“开放”数据集本身也是由 LLM 参与生成或标注的。比如 FineMath 3 使用 Llama 做标注,后续 OLMo 的数学数据管线里还用了 Qwen。作者的核心观点是,“开放”不必追求纯度,而应看数据是否足够可获取、可复现,能否支持公众继续构建模型。
「漫话AGI」频道最新
- Sam Altman:AGI 不是单模型,而是背后的整套机器 — haider1 · 2026-07-29
- 转发帖主张别写公开信,直接教人用 AI — inductionheads · 2026-07-29
- Nature 指出 AI 热潮可能带偏意识研究方向 — anilkseth · 2026-07-29
- RSI 大概率还没发生,至少不是强意义上的那种 — CFGeek · 2026-07-29
- 限制更聪明模型的访问,与智能民主化目标相冲突 — djcows · 2026-07-29
- Peter Wildeford:美国放缓 AI 也必须让中国同步约束 — peterwildeford · 2026-07-29