个人开发者如何获取训练数据:从LibGen提取电子书
theshawwn · x · 2026-08-12
针对个人爱好者在当下如何获取大模型训练数据的问题,开发者 Shawn 提供了一个实操方案:
- 数据来源:下载 LibGen(影子图书馆),保存其中的 epub 电子书文件并丢弃其他格式。
- 提取脚本:使用他开源的 epub2text 脚本将这些电子书转换为纯文本。
他提到,这是目前唯一真正去中心化的训练数据来源。虽然获取途径本身是非法的,但只要不以此直接建立商业业务,通常不会有问题。如果要做正规商业项目,建议效仿大厂批量收购旧实体书进行数字化。
「研究」频道最新
- 研究发现:推理模型思考越深,越不爱向人类提问澄清 — xuanalogue · 2026-08-12
- 开源数据集实测:AI 究竟加速了哪些领域的科学发现? — soumitrashukla9 · 2026-08-12
- AI 自动研究工具已上线半年,算法效率未见明显加速 — soumitrashukla9 · 2026-08-12
- 研究揭示 Grok 模型家族的人格演变轨迹 — DevDminGod · 2026-08-12
- STACX: 端到端智能体强化学习模块化基础设施 — daibond_alpha · 2026-08-12
- NeurIPS 2026研讨会:构建医疗高风险领域的世界模型 — yaringal · 2026-08-12