殆知阁古文献数据集转 Markdown 开源,并系统性修复已污染 AI 语料的错误
vista8 · x · 2026-10-07
博主分享 GitHub 上的「殆知阁」中国古代文献原始数据仓库(523 star),收录佛藏、儒藏、道藏、四库全书、医藏、易藏等大量古典文献,并配套全文检索网站 daizhigie.org。
该仓库将原 TXT 全部转为 Markdown 并加 YAML 元数据,重点工作是系统性纠错:原数据集已被大量研究机构用于 AI 训练,但存在繁简转换错误(如「记忆体」应为「内存」、「香港脚」应为「脚气」、「利瓦伊」应为「李维」)、混入论坛内容、残留 HTML 脚本等问题,可能已经污染中文古文语料。项目持续更新,适合做古籍语料或中文 AI 训练数据的研究者收藏。
「研究」频道最新
- 把 Claude Code、Codex 等 10 个 harness 转 RL 环境,工具调用降 31% — vllm_project · 2026-10-07
- Google DeepMind 等发 IdeaLens:读大纲即可识别想法是否出自 AI — rohanpaul_ai · 2026-10-07
- Anima Anandkumar 首访联合国:AI for Science 的「静默革命」 — AnimaAnandkumar · 2026-10-07
- WRAP 框架用 Wasserstein 对抗训练解决非平稳市场深度对冲 — chaumian · 2026-10-07
- NYU 提出 CIA 指标:LLM 思维链仅 44.8%-75.9% 反映内部计算 — newyorkuniversity · 2026-10-07
- 牛津 AI Theorist 自主破解 α-RuCl₃ 光谱之谜,AI4Science 里程碑 — Oxford · 2026-10-07